PDF Tools
All tools, free, in your browser.
PDF kostenlos online in XML umwandeln
Exportieren Sie den Textinhalt eines PDFs als strukturiertes XML mit Seitenzahlen und Koordinaten. Unterstützt die Auswahl von Seitenbereichen.
So wandeln Sie ein PDF online in XML um
- Klicken Sie auf Datei auswählen oder ziehen Sie Ihr PDF in den Upload-Bereich.
- Legen Sie optional einen Seitenbereich fest, wenn Sie nur einen Teil des Dokuments benötigen.
- Klicken Sie auf In XML umwandeln und warten Sie, während pdf.js den Text und die Koordinaten jeder Seite analysiert.
- Laden Sie die
.xml-Datei direkt auf Ihr Gerät herunter – ohne Anmeldung.
Wie die XML-Struktur aussieht und was sie erfasst
Das Ergebnis ist ein wohlgeformtes UTF-8-XML-Dokument. Ein Wurzelelement <document> enthält pro umgewandelter Seite ein untergeordnetes Element <page number="N">. Innerhalb jeder Seite enthalten <text>-Elemente den extrahierten Textinhalt zusammen mit den Attributen x, y, width und height, die den Begrenzungsrahmen in PDF-Benutzereinheiten darstellen. Dadurch ist das Ergebnis ohne weitere Transformation maschinenlesbar: Sie können es per XPath abfragen, in einen DOM-Parser laden oder mit einem XSLT-Stylesheet verarbeiten. Ein wichtiger Vorbehalt: Der Konverter ist auf die im PDF eingebettete Textebene angewiesen. Reine Layout-PDFs (die ausschließlich aus Bildern oder gezeichneten Pfaden ohne Textobjekte bestehen) erzeugen ein XML-Gerüst mit leerem Textinhalt. Gescannte Dokumente fallen in diese Kategorie und erfordern zuerst einen OCR-Durchlauf.
Wann Sie PDF in XML verwenden sollten
Dieses Tool eignet sich für jeden Arbeitsablauf, der ein PDF als strukturierte Daten statt als festes visuelles Artefakt behandeln muss. Typische Szenarien sind: das Einlesen von Vertrags- oder Rechnungstext in eine Datenpipeline, die XML-Eingaben erwartet; das Archivieren von Dokumentinhalten in einem Format, das auch ohne PDF-Werkzeuge analysierbar bleibt; das Migrieren großer Dokumentbestände in ein CMS oder eine Datenbank, die XML-Feeds akzeptiert; und automatisierte Qualitätsprüfungen, bei denen ein Skript überprüft, ob erforderliche Formulierungen oder Überschriften an den erwarteten Koordinaten erscheinen. Die Option für Seitenbereiche ist besonders nützlich, wenn nur ein bestimmter Abschnitt eines umfangreichen Berichts die benötigten Daten enthält – das spart Analysezeit und hält die Ausgabedatei klein.
Häufige Fragen
- Was enthält das erzeugte XML eigentlich?
Das erzeugte XML fasst das Dokument in einem Wurzelelement zusammen und gruppiert den Inhalt anschließend nach Seiten. Jedes Seitenelement trägt ein Nummernattribut und enthält untergeordnete Textblockelemente. Jeder Textblock erfasst die extrahierte Zeichenfolge zusammen mit ihren x/y-Koordinaten und den Abmessungen des Begrenzungsrahmens als Attribute, sodass Sie die ungefähre Lesereihenfolge oder die räumliche Anordnung programmgesteuert rekonstruieren können.
- Bewahrt das Tool die Dokumentstruktur oder gibt es nur Rohtext aus?
Das Tool geht über eine reine Textausgabe hinaus. Mit pdf.js werden die Textelemente samt ihrer Position auf jeder Seite extrahiert, und diese Elemente werden als strukturierte XML-Elemente mit Koordinaten-Metadaten serialisiert. Überschriften und Fließtext werden im Ergebnis nicht semantisch unterschieden – diese Klassifizierung würde eine heuristische Nachbearbeitung auf Ihrer Seite erfordern –, aber die räumlichen Daten sind vorhanden, um sie zu unterstützen.
- Funktioniert es mit einem gescannten PDF?
Nur teilweise. Gescannte PDFs sind Bilder; sie enthalten keine eingebettete Textebene. Der Konverter erzeugt eine XML-Datei mit leeren oder nahezu leeren Seitenelementen. Wenn Sie den Text eines gescannten Dokuments benötigen, verarbeiten Sie es zuerst mit dem OCR-PDF-Tool, um eine Textebene einzubetten, und wandeln Sie es dann in XML um.
- Kann ich bestimmte Seiten statt der ganzen Datei auswählen?
Ja. Das Tool enthält einen Seitenbereichswähler. Geben Sie eine einzelne Seite, eine durch Kommas getrennte Liste oder einen Bereich mit Bindestrich (zum Beispiel 2-8) ein, um die Umwandlung auf diese Seiten zu beschränken. Nur die angegebenen Seiten erscheinen im erzeugten XML, und ihre Seitennummernattribute entsprechen der ursprünglichen Dokumentnummerierung.
- Verlässt meine Datei während der Umwandlung mein Gerät?
Nein. Die Umwandlung erfolgt vollständig in Ihrem Browser über WebAssembly. Ihr PDF wird aus dem lokalen Speicher gelesen, auf dem Gerät analysiert, und das erzeugte XML wird ohne jegliche Netzwerkübertragung zusammengestellt und heruntergeladen. Keine Datei erreicht jemals einen Server.