PDF Tools

All tools, free, in your browser.

VoxScan PDF-инструменты Конвертировать из PDF Конвертировать PDF в XML бесплатно онлайн

Конвертировать PDF в XML бесплатно онлайн

Экспортируйте текстовое содержимое PDF как структурированный XML с номерами страниц и координатами. Поддерживает выбор диапазона страниц.

Структурированный XMLДанные страницы и позицииВыбор страницКодировка UTF-8

Как конвертировать PDF в XML онлайн

  1. Нажмите Выбрать файл или перетащите PDF в зону загрузки.
  2. При необходимости задайте диапазон страниц, если вам нужна только часть документа.
  3. Нажмите Конвертировать в XML и подождите, пока pdf.js обработает текст и координаты каждой страницы.
  4. Скачайте файл .xml прямо на устройство — без регистрации.

Как выглядит структура XML и что она фиксирует

Результат — правильно сформированный XML-документ в UTF-8. Корневой элемент <document> содержит по одному дочернему элементу <page number="N"> на каждую преобразованную страницу. Внутри каждой страницы элементы <text> содержат извлечённый текст вместе с атрибутами x, y, width и height, представляющими ограничивающую рамку в пользовательских единицах PDF. Благодаря этому результат читается машиной без дополнительных преобразований: вы можете обращаться к нему через XPath, загрузить в DOM-парсер или обработать таблицей стилей XSLT. Важная оговорка: конвертер опирается на встроенный в PDF текстовый слой. PDF-файлы, состоящие только из изображений или нарисованных контуров без текстовых объектов, дадут XML-каркас с пустым текстовым содержимым. Отсканированные документы относятся к этой категории и требуют предварительного распознавания (OCR).

Когда использовать преобразование PDF в XML

Этот инструмент подходит для любого процесса, в котором PDF нужно рассматривать как структурированные данные, а не как фиксированный визуальный объект. Типичные сценарии: загрузка текста договоров или счетов в конвейер данных, ожидающий ввод в формате XML; архивирование содержимого документов в формате, который остаётся пригодным для анализа без PDF-инструментов; перенос больших библиотек документов в CMS или базу данных, принимающую XML-каналы; и автоматические проверки качества, когда скрипт проверяет, что нужные фразы или заголовки находятся в ожидаемых координатах. Параметр диапазона страниц особенно полезен, когда нужные данные содержатся только в определённом разделе большого отчёта, что экономит время анализа и уменьшает размер выходного файла.

Частые вопросы

Что на самом деле содержит созданный XML?

Созданный XML оборачивает документ в корневой элемент, а затем группирует содержимое по страницам. Каждый элемент страницы имеет атрибут номера и содержит дочерние элементы текстовых блоков. Каждый текстовый блок записывает извлечённую строку вместе с её координатами x/y и размерами ограничивающей рамки в виде атрибутов, что позволяет программно восстановить приблизительный порядок чтения или пространственное расположение.

Сохраняет ли инструмент структуру документа или просто выгружает необработанный текст?

Инструмент делает больше, чем простую выгрузку текста. pdf.js используется для извлечения текстовых элементов с их позицией на каждой странице, и эти элементы сериализуются в структурированные элементы XML с метаданными координат. Заголовки и основной текст не различаются семантически в результате — такая классификация потребовала бы эвристической постобработки с вашей стороны, — но пространственные данные присутствуют для её поддержки.

Работает ли это с отсканированным PDF?

Лишь частично. Отсканированные PDF — это изображения; они не содержат встроенного текстового слоя. Конвертер создаст XML-файл с пустыми или почти пустыми элементами страниц. Если вам нужен текст из отсканированного документа, сначала обработайте его инструментом OCR PDF, чтобы встроить текстовый слой, а затем преобразуйте в XML.

Можно ли выбрать определённые страницы вместо всего файла?

Да. В инструменте есть выбор диапазона страниц. Введите одну страницу, список через запятую или диапазон через дефис (например, 2-8), чтобы ограничить преобразование этими страницами. В созданном XML появляются только указанные страницы, а их атрибуты номеров страниц соответствуют исходной нумерации документа.

Покидает ли мой файл устройство во время преобразования?

Нет. Преобразование выполняется полностью в вашем браузере с помощью WebAssembly. Ваш PDF читается из локальной памяти, обрабатывается на устройстве, а полученный XML собирается и скачивается без какой-либо передачи по сети. Ни один файл никогда не попадает на сервер.