PDF Tools

All tools, free, in your browser.

VoxScan Outils PDF Convertir depuis un PDF Convertir un PDF en XML gratuitement en ligne

Convertir un PDF en XML gratuitement en ligne

Exportez le contenu textuel d'un PDF en XML structuré avec numéros de page et coordonnées. Prend en charge la sélection de plages de pages.

XML structuréDonnées de page et de positionSélectionner des pagesEncodé en UTF-8
Tous les outils

Comment convertir un PDF en XML en ligne

  1. Cliquez sur Choisir un fichier ou glissez votre PDF dans la zone d'envoi.
  2. Définissez éventuellement une plage de pages si vous n'avez besoin que d'une partie du document.
  3. Cliquez sur Convertir en XML et patientez pendant que pdf.js analyse le texte et les coordonnées de chaque page.
  4. Téléchargez le fichier .xml directement sur votre appareil, sans inscription.

À quoi ressemble la structure XML et ce qu'elle capture

Le résultat est un document XML UTF-8 bien formé. Un élément racine <document> contient un élément enfant <page number="N"> par page convertie. Au sein de chaque page, les éléments <text> contiennent le texte extrait avec les attributs x, y, width et height représentant le cadre de délimitation en unités utilisateur PDF. Le résultat est ainsi exploitable par une machine sans transformation supplémentaire : vous pouvez l'interroger avec XPath, le charger dans un analyseur DOM ou le traiter avec une feuille de style XSLT. Une réserve importante : le convertisseur repose sur la couche de texte intégrée au PDF. Les PDF composés uniquement d'images ou de tracés, sans objets texte, produiront un squelette XML au contenu textuel vide. Les documents numérisés entrent dans cette catégorie et nécessitent d'abord une étape d'OCR.

Quand utiliser la conversion PDF en XML

Cet outil convient à tout flux de travail qui doit traiter un PDF comme des données structurées plutôt que comme un document visuel figé. Les cas typiques incluent : intégrer le texte de contrats ou de factures dans un pipeline de données attendant une entrée XML ; archiver le contenu de documents dans un format qui reste analysable sans outils PDF ; migrer des bibliothèques de documents en masse vers un CMS ou une base de données acceptant des flux XML ; et des contrôles qualité automatisés où un script vérifie que les phrases ou les titres requis apparaissent aux coordonnées attendues. L'option de plage de pages est particulièrement utile lorsqu'une seule section d'un long rapport contient les données dont vous avez besoin, ce qui réduit le temps d'analyse et la taille du fichier de sortie.

Questions fréquentes

Que contient réellement le XML produit ?

Le XML produit enveloppe le document dans un élément racine, puis regroupe le contenu par page. Chaque élément de page porte un attribut de numéro et contient des éléments enfants de blocs de texte. Chaque bloc de texte enregistre la chaîne extraite ainsi que ses coordonnées x/y et les dimensions de son cadre de délimitation sous forme d'attributs, ce qui vous permet de reconstituer par programmation l'ordre de lecture approximatif ou la disposition spatiale.

L'outil préserve-t-il la structure du document ou se contente-t-il de vider le texte brut ?

L'outil va au-delà d'un simple vidage de texte. pdf.js est utilisé pour extraire les éléments de texte avec leur position sur chaque page, et ces éléments sont sérialisés en éléments XML structurés avec des métadonnées de coordonnées. Les titres et le corps du texte ne sont pas distingués sémantiquement dans le résultat — cette classification nécessiterait un post-traitement heuristique de votre côté —, mais les données spatiales sont présentes pour la prendre en charge.

Cela fonctionne-t-il avec un PDF numérisé ?

Seulement en partie. Les PDF numérisés sont des images ; ils ne contiennent pas de couche de texte intégrée. Le convertisseur produira un fichier XML avec des éléments de page vides ou presque vides. Si vous avez besoin du texte d'un document numérisé, passez-le d'abord par l'outil OCR PDF pour y intégrer une couche de texte, puis convertissez-le en XML.

Puis-je cibler des pages précises plutôt que tout le fichier ?

Oui. L'outil comprend un sélecteur de plage de pages. Saisissez une seule page, une liste séparée par des virgules ou une plage avec un tiret (par exemple, 2-8) pour limiter la conversion à ces pages. Seules les pages indiquées apparaissent dans le XML produit, et leurs attributs de numéro de page reflètent la numérotation d'origine du document.

Mon fichier quitte-t-il mon appareil pendant la conversion ?

Non. La conversion s'exécute entièrement dans votre navigateur via WebAssembly. Votre PDF est lu depuis la mémoire locale, analysé sur l'appareil, et le XML produit est assemblé et téléchargé sans aucun transfert réseau. Aucun fichier n'atteint jamais un serveur.