PDF Tools
All tools, free, in your browser.
Конвертировать PDF в XML бесплатно онлайн
Экспортируйте текстовое содержимое PDF как структурированный XML с номерами страниц и координатами. Поддерживает выбор диапазона страниц.
Как конвертировать PDF в XML онлайн
- Нажмите Выбрать файл или перетащите PDF в зону загрузки.
- При необходимости задайте диапазон страниц, если вам нужна только часть документа.
- Нажмите Конвертировать в XML и подождите, пока pdf.js обработает текст и координаты каждой страницы.
- Скачайте файл
.xmlпрямо на устройство — без регистрации.
Как выглядит структура XML и что она фиксирует
Результат — правильно сформированный XML-документ в UTF-8. Корневой элемент <document> содержит по одному дочернему элементу <page number="N"> на каждую преобразованную страницу. Внутри каждой страницы элементы <text> содержат извлечённый текст вместе с атрибутами x, y, width и height, представляющими ограничивающую рамку в пользовательских единицах PDF. Благодаря этому результат читается машиной без дополнительных преобразований: вы можете обращаться к нему через XPath, загрузить в DOM-парсер или обработать таблицей стилей XSLT. Важная оговорка: конвертер опирается на встроенный в PDF текстовый слой. PDF-файлы, состоящие только из изображений или нарисованных контуров без текстовых объектов, дадут XML-каркас с пустым текстовым содержимым. Отсканированные документы относятся к этой категории и требуют предварительного распознавания (OCR).
Когда использовать преобразование PDF в XML
Этот инструмент подходит для любого процесса, в котором PDF нужно рассматривать как структурированные данные, а не как фиксированный визуальный объект. Типичные сценарии: загрузка текста договоров или счетов в конвейер данных, ожидающий ввод в формате XML; архивирование содержимого документов в формате, который остаётся пригодным для анализа без PDF-инструментов; перенос больших библиотек документов в CMS или базу данных, принимающую XML-каналы; и автоматические проверки качества, когда скрипт проверяет, что нужные фразы или заголовки находятся в ожидаемых координатах. Параметр диапазона страниц особенно полезен, когда нужные данные содержатся только в определённом разделе большого отчёта, что экономит время анализа и уменьшает размер выходного файла.
Частые вопросы
- Что на самом деле содержит созданный XML?
Созданный XML оборачивает документ в корневой элемент, а затем группирует содержимое по страницам. Каждый элемент страницы имеет атрибут номера и содержит дочерние элементы текстовых блоков. Каждый текстовый блок записывает извлечённую строку вместе с её координатами x/y и размерами ограничивающей рамки в виде атрибутов, что позволяет программно восстановить приблизительный порядок чтения или пространственное расположение.
- Сохраняет ли инструмент структуру документа или просто выгружает необработанный текст?
Инструмент делает больше, чем простую выгрузку текста. pdf.js используется для извлечения текстовых элементов с их позицией на каждой странице, и эти элементы сериализуются в структурированные элементы XML с метаданными координат. Заголовки и основной текст не различаются семантически в результате — такая классификация потребовала бы эвристической постобработки с вашей стороны, — но пространственные данные присутствуют для её поддержки.
- Работает ли это с отсканированным PDF?
Лишь частично. Отсканированные PDF — это изображения; они не содержат встроенного текстового слоя. Конвертер создаст XML-файл с пустыми или почти пустыми элементами страниц. Если вам нужен текст из отсканированного документа, сначала обработайте его инструментом OCR PDF, чтобы встроить текстовый слой, а затем преобразуйте в XML.
- Можно ли выбрать определённые страницы вместо всего файла?
Да. В инструменте есть выбор диапазона страниц. Введите одну страницу, список через запятую или диапазон через дефис (например, 2-8), чтобы ограничить преобразование этими страницами. В созданном XML появляются только указанные страницы, а их атрибуты номеров страниц соответствуют исходной нумерации документа.
- Покидает ли мой файл устройство во время преобразования?
Нет. Преобразование выполняется полностью в вашем браузере с помощью WebAssembly. Ваш PDF читается из локальной памяти, обрабатывается на устройстве, а полученный XML собирается и скачивается без какой-либо передачи по сети. Ни один файл никогда не попадает на сервер.