PDF Tools

All tools, free, in your browser.

VoxScan Ferramentas PDF Converter de PDF Converter PDF para XML grátis online

Converter PDF para XML grátis online

Exporte o conteúdo de texto de um PDF como XML estruturado com números de página e coordenadas. Compatível com seleção de intervalo de páginas.

XML estruturadoDados de página e posiçãoSelecionar páginasCodificado em UTF-8

Como converter um PDF para XML online

  1. Clique em Escolher arquivo ou arraste seu PDF para a área de envio.
  2. Opcionalmente, defina um intervalo de páginas se precisar de apenas uma parte do documento.
  3. Clique em Converter para XML e aguarde enquanto o pdf.js analisa o texto e as coordenadas de cada página.
  4. Baixe o arquivo .xml diretamente no seu dispositivo, sem precisar se cadastrar.

Como é a estrutura do XML e o que ela captura

O resultado é um documento XML em UTF-8 bem formado. Um elemento raiz <document> contém um elemento filho <page number="N"> para cada página convertida. Dentro de cada página, os elementos <text> contêm o conteúdo de texto extraído junto com os atributos x, y, width e height, que representam a caixa delimitadora em unidades de usuário do PDF. Isso torna o resultado legível por máquina sem mais transformações: você pode usar XPath, carregá-lo em um analisador DOM ou processá-lo com uma folha de estilos XSLT. Uma ressalva importante: o conversor depende da camada de texto incorporada no PDF. PDFs compostos apenas por imagens ou traços desenhados, sem objetos de texto, produzirão um esqueleto XML com o conteúdo de texto vazio. Documentos digitalizados se enquadram nessa categoria e exigem primeiro um processo de OCR.

Quando usar PDF para XML

Esta ferramenta se encaixa em qualquer fluxo de trabalho que precise tratar um PDF como dados estruturados em vez de um documento visual fixo. Cenários típicos incluem: incorporar o texto de contratos ou notas fiscais a um pipeline de dados que espera entrada XML; arquivar o conteúdo de documentos em um formato que permaneça analisável sem ferramentas de PDF; migrar bibliotecas de documentos em massa para um CMS ou banco de dados que aceite feeds XML; e verificações de qualidade automatizadas em que um script valida se as frases ou os títulos exigidos aparecem nas coordenadas esperadas. A opção de intervalo de páginas é especialmente útil quando apenas uma seção específica de um relatório extenso contém os dados de que você precisa, economizando tempo de análise e mantendo o arquivo de saída pequeno.

Perguntas frequentes

O que o XML resultante realmente contém?

O XML resultante envolve o documento em um elemento raiz e depois agrupa o conteúdo por página. Cada elemento de página carrega um atributo de número e contém elementos filhos de blocos de texto. Cada bloco de texto registra a string extraída junto com suas coordenadas x/y e as dimensões da caixa delimitadora como atributos, para que você possa reconstruir programaticamente a ordem de leitura aproximada ou a disposição espacial.

A ferramenta preserva a estrutura do documento ou apenas despeja texto bruto?

A ferramenta vai além de um despejo de texto simples. O pdf.js é usado para extrair os elementos de texto com sua posição em cada página, e esses elementos são serializados como elementos XML estruturados com metadados de coordenadas. Títulos e corpo de texto não são distinguidos semanticamente no resultado — essa classificação exigiria um pós-processamento heurístico do seu lado —, mas os dados espaciais estão lá para apoiá-la.

Funciona com um PDF digitalizado?

Apenas parcialmente. PDFs digitalizados são imagens; não contêm uma camada de texto incorporada. O conversor produzirá um arquivo XML com elementos de página vazios ou quase vazios. Se você precisar do texto de um documento digitalizado, passe-o primeiro pela ferramenta OCR PDF para incorporar uma camada de texto e depois converta para XML.

Posso converter páginas específicas em vez do arquivo inteiro?

Sim. A ferramenta inclui um seletor de intervalo de páginas. Insira uma única página, uma lista separada por vírgulas ou um intervalo com hífen (por exemplo, 2-8) para limitar a conversão a essas páginas. Apenas as páginas especificadas aparecem no XML resultante, e seus atributos de número de página refletem a numeração original do documento.

Meu arquivo sai do meu dispositivo durante a conversão?

Não. A conversão é executada inteiramente no seu navegador via WebAssembly. Seu PDF é lido da memória local, analisado no dispositivo, e o XML resultante é gerado e baixado sem nenhuma transferência pela rede. Nenhum arquivo chega a um servidor.