PDF Tools
All tools, free, in your browser.
Konwertuj PDF na XML za darmo online
Eksportuj zawartość tekstową PDF jako ustrukturyzowany XML z numerami stron i współrzędnymi. Obsługuje wybór zakresu stron.
Jak przekonwertować PDF na XML online
- Kliknij Wybierz plik lub przeciągnij PDF do strefy przesyłania.
- Opcjonalnie ustaw zakres stron, jeśli potrzebujesz tylko części dokumentu.
- Kliknij Konwertuj na XML i poczekaj, aż pdf.js przeanalizuje tekst i współrzędne każdej strony.
- Pobierz plik
.xmlbezpośrednio na swoje urządzenie — bez rejestracji.
Jak wygląda struktura XML i co przechwytuje
Wynikiem jest poprawnie sformułowany dokument XML w UTF-8. Element główny <document> zawiera jeden element podrzędny <page number="N"> na każdą przekonwertowaną stronę. Wewnątrz każdej strony elementy <text> przechowują wyodrębnioną treść tekstową wraz z atrybutami x, y, width i height reprezentującymi ramkę ograniczającą w jednostkach użytkownika PDF. Dzięki temu wynik jest odczytywalny maszynowo bez dalszego przetwarzania: możesz przeszukiwać go za pomocą XPath, wczytać do parsera DOM lub przetworzyć arkuszem stylów XSLT. Ważne zastrzeżenie: konwerter opiera się na warstwie tekstowej osadzonej w PDF. Pliki PDF złożone wyłącznie z obrazów lub narysowanych ścieżek, bez obiektów tekstowych, utworzą szkielet XML z pustą treścią tekstową. Zeskanowane dokumenty należą do tej kategorii i wymagają najpierw przetworzenia OCR.
Kiedy używać konwersji PDF na XML
To narzędzie pasuje do każdego procesu, który musi traktować PDF jako dane ustrukturyzowane, a nie jako stały element wizualny. Typowe scenariusze obejmują: wczytywanie tekstu umów lub faktur do potoku danych oczekującego danych XML; archiwizowanie treści dokumentów w formacie, który pozostaje możliwy do analizy bez narzędzi PDF; migrację dużych bibliotek dokumentów do systemu CMS lub bazy danych akceptującej kanały XML; oraz zautomatyzowane kontrole jakości, w których skrypt sprawdza, czy wymagane frazy lub nagłówki pojawiają się na oczekiwanych współrzędnych. Opcja zakresu stron jest szczególnie przydatna, gdy tylko określona sekcja długiego raportu zawiera potrzebne dane, co oszczędza czas analizy i utrzymuje mały rozmiar pliku wyjściowego.
Najczęstsze pytania
- Co właściwie zawiera utworzony plik XML?
Utworzony XML opakowuje dokument w element główny, a następnie grupuje treść według stron. Każdy element strony ma atrybut numeru i zawiera podrzędne elementy bloków tekstu. Każdy blok tekstu zapisuje wyodrębniony ciąg wraz ze współrzędnymi x/y oraz wymiarami ramki ograniczającej jako atrybuty, dzięki czemu możesz programowo odtworzyć przybliżoną kolejność czytania lub układ przestrzenny.
- Czy narzędzie zachowuje strukturę dokumentu, czy tylko zrzuca surowy tekst?
Narzędzie wykracza poza zwykły zrzut tekstu. pdf.js służy do wyodrębniania elementów tekstu wraz z ich pozycją na każdej stronie, a elementy te są serializowane jako ustrukturyzowane elementy XML z metadanymi współrzędnych. Nagłówki i tekst główny nie są w wyniku rozróżniane semantycznie — taka klasyfikacja wymagałaby heurystycznego przetwarzania końcowego po Twojej stronie — ale dane przestrzenne są dostępne, aby to wesprzeć.
- Czy działa ze zeskanowanym plikiem PDF?
Tylko częściowo. Zeskanowane pliki PDF to obrazy; nie zawierają osadzonej warstwy tekstowej. Konwerter utworzy plik XML z pustymi lub niemal pustymi elementami stron. Jeśli potrzebujesz tekstu ze zeskanowanego dokumentu, najpierw przetwórz go narzędziem OCR PDF, aby osadzić warstwę tekstową, a następnie przekonwertuj na XML.
- Czy mogę wybrać konkretne strony zamiast całego pliku?
Tak. Narzędzie zawiera selektor zakresu stron. Wprowadź pojedynczą stronę, listę oddzieloną przecinkami lub zakres z myślnikiem (na przykład 2-8), aby ograniczyć konwersję do tych stron. W utworzonym pliku XML pojawiają się tylko wskazane strony, a ich atrybuty numerów stron odzwierciedlają oryginalną numerację dokumentu.
- Czy mój plik opuszcza moje urządzenie podczas konwersji?
Nie. Konwersja odbywa się w całości w Twojej przeglądarce za pomocą WebAssembly. Twój PDF jest odczytywany z pamięci lokalnej, analizowany na urządzeniu, a utworzony XML jest składany i pobierany bez żadnego przesyłania przez sieć. Żaden plik nigdy nie trafia na serwer.