PDF Tools

All tools, free, in your browser.

VoxScan PDF-tools Vanuit PDF converteren PDF gratis online naar XML converteren

PDF gratis online naar XML converteren

Exporteer de tekstinhoud van een PDF als gestructureerde XML met paginanummers en coördinaten. Ondersteunt selectie van paginabereik.

Gestructureerde XMLPagina- en positiegegevensPagina's selecterenUTF-8-gecodeerd
Alle tools

Een PDF online naar XML converteren

  1. Klik op Bestand kiezen of sleep je PDF naar de uploadzone.
  2. Stel eventueel een paginabereik in als je maar een deel van het document nodig hebt.
  3. Klik op Naar XML converteren en wacht terwijl pdf.js de tekst en coördinaten van elke pagina analyseert.
  4. Download het .xml-bestand rechtstreeks naar je apparaat, zonder registratie.

Hoe de XML-structuur eruitziet en wat deze vastlegt

Het resultaat is een goed gevormd UTF-8-XML-document. Een hoofdelement <document> bevat één onderliggend element <page number="N"> per geconverteerde pagina. Binnen elke pagina bevatten <text>-elementen de geëxtraheerde tekstinhoud samen met de attributen x, y, width en height die het selectiekader in PDF-gebruikerseenheden weergeven. Hierdoor is het resultaat machineleesbaar zonder verdere bewerking: je kunt het met XPath bevragen, in een DOM-parser laden of via een XSLT-stylesheet verwerken. Een belangrijke kanttekening: de converter is afhankelijk van de in de PDF ingesloten tekstlaag. PDF's die alleen uit afbeeldingen of getekende paden bestaan, zonder tekstobjecten, leveren een XML-geraamte met lege tekstinhoud op. Gescande documenten vallen in deze categorie en vereisen eerst een OCR-stap.

Wanneer PDF naar XML gebruiken

Deze tool past bij elke workflow die een PDF als gestructureerde gegevens moet behandelen in plaats van als een vast visueel document. Typische scenario's zijn: het inlezen van contract- of factuurtekst in een datapijplijn die XML-invoer verwacht; het archiveren van documentinhoud in een formaat dat ook zonder PDF-tools te verwerken blijft; het migreren van grote documentbibliotheken naar een CMS of database die XML-feeds accepteert; en geautomatiseerde kwaliteitscontroles waarbij een script verifieert of vereiste zinnen of koppen op de verwachte coördinaten verschijnen. De optie voor paginabereik is vooral handig wanneer slechts een specifiek deel van een lang rapport de gegevens bevat die je nodig hebt, wat analysetijd bespaart en het uitvoerbestand klein houdt.

Veelgestelde vragen

Wat bevat de geproduceerde XML precies?

De geproduceerde XML omhult het document in een hoofdelement en groepeert de inhoud vervolgens per pagina. Elk pagina-element draagt een nummerattribuut en bevat onderliggende tekstblokelementen. Elk tekstblok registreert de geëxtraheerde tekenreeks samen met de x/y-coördinaten en de afmetingen van het selectiekader als attributen, zodat je de geschatte leesvolgorde of de ruimtelijke indeling programmatisch kunt reconstrueren.

Behoudt de tool de documentstructuur of dumpt deze alleen ruwe tekst?

De tool gaat verder dan een platte tekstdump. pdf.js wordt gebruikt om de tekstelementen met hun positie op elke pagina te extraheren, en die elementen worden geserialiseerd als gestructureerde XML-elementen met coördinaatmetadata. Koppen en hoofdtekst worden in het resultaat niet semantisch onderscheiden — die classificatie zou heuristische nabewerking aan jouw kant vereisen —, maar de ruimtelijke gegevens zijn aanwezig om dit te ondersteunen.

Werkt het met een gescande PDF?

Slechts gedeeltelijk. Gescande PDF's zijn afbeeldingen; ze bevatten geen ingesloten tekstlaag. De converter levert een XML-bestand met lege of bijna lege pagina-elementen op. Als je de tekst van een gescand document nodig hebt, verwerk het dan eerst met de OCR PDF-tool om een tekstlaag in te sluiten en converteer het daarna naar XML.

Kan ik specifieke pagina's converteren in plaats van het hele bestand?

Ja. De tool bevat een paginabereikselectie. Voer een enkele pagina, een door komma's gescheiden lijst of een bereik met een koppelteken (bijvoorbeeld 2-8) in om de conversie tot die pagina's te beperken. Alleen de opgegeven pagina's verschijnen in de geproduceerde XML, en hun paginanummerattributen weerspiegelen de oorspronkelijke documentnummering.

Verlaat mijn bestand mijn apparaat tijdens de conversie?

Nee. De conversie wordt volledig in je browser uitgevoerd via WebAssembly. Je PDF wordt uit het lokale geheugen gelezen, op het apparaat geanalyseerd, en de geproduceerde XML wordt samengesteld en gedownload zonder enige netwerkoverdracht. Geen enkel bestand bereikt ooit een server.