PDF Tools

All tools, free, in your browser.

VoxScan Herramientas PDF Convertir desde PDF Convertir PDF a XML gratis online

Convertir PDF a XML gratis online

Exporta el contenido de texto de un PDF como XML estructurado con números de página y coordenadas. Admite la selección de rangos de páginas.

XML estructuradoDatos de página y posiciónSeleccionar páginasCodificado en UTF-8

Cómo convertir un PDF a XML online

  1. Haz clic en Elegir archivo o arrastra tu PDF a la zona de carga.
  2. Si lo deseas, define un rango de páginas si solo necesitas una parte del documento.
  3. Haz clic en Convertir a XML y espera mientras pdf.js analiza el texto y las coordenadas de cada página.
  4. Descarga el archivo .xml directamente en tu dispositivo, sin necesidad de registrarte.

Cómo es la estructura del XML y qué captura

El resultado es un documento XML en UTF-8 bien formado. Un elemento raíz <document> contiene un elemento hijo <page number="N"> por cada página convertida. Dentro de cada página, los elementos <text> contienen el texto extraído junto con los atributos x, y, width y height, que representan el cuadro delimitador en unidades de usuario de PDF. Esto hace que el resultado sea legible por máquina sin más transformaciones: puedes consultarlo con XPath, cargarlo en un analizador DOM o procesarlo con una hoja de estilos XSLT. Una advertencia importante: el conversor depende de la capa de texto incrustada en el PDF. Los PDF compuestos solo por imágenes o trazados dibujados, sin objetos de texto, producirán un esqueleto XML con el contenido de texto vacío. Los documentos escaneados entran en esta categoría y requieren primero un proceso de OCR.

Cuándo usar PDF a XML

Esta herramienta encaja en cualquier flujo de trabajo que necesite tratar un PDF como datos estructurados en lugar de como un documento visual fijo. Algunos escenarios típicos son: incorporar el texto de contratos o facturas a una canalización de datos que espera entrada XML; archivar el contenido de documentos en un formato que siga siendo analizable sin herramientas de PDF; migrar bibliotecas de documentos masivas a un CMS o una base de datos que acepte fuentes XML; y controles de calidad automatizados en los que un script valida que las frases o los encabezados requeridos aparecen en las coordenadas esperadas. La opción de rango de páginas resulta especialmente útil cuando solo una sección concreta de un informe extenso contiene los datos que necesitas, ya que ahorra tiempo de análisis y mantiene pequeño el archivo de salida.

Preguntas frecuentes

¿Qué contiene realmente el XML resultante?

El XML resultante envuelve el documento en un elemento raíz y luego agrupa el contenido por página. Cada elemento de página lleva un atributo de número y contiene elementos hijos de bloques de texto. Cada bloque de texto registra la cadena extraída junto con sus coordenadas x/y y las dimensiones del cuadro delimitador como atributos, de modo que puedas reconstruir mediante programación el orden de lectura aproximado o la disposición espacial.

¿La herramienta conserva la estructura del documento o solo vuelca texto sin formato?

La herramienta va más allá de un volcado de texto plano. Se utiliza pdf.js para extraer los elementos de texto con su posición en cada página, y esos elementos se serializan como elementos XML estructurados con metadatos de coordenadas. Los encabezados y el cuerpo del texto no se distinguen semánticamente en el resultado —esa clasificación requeriría un posprocesamiento heurístico por tu parte—, pero los datos espaciales están disponibles para respaldarla.

¿Funciona con un PDF escaneado?

Solo parcialmente. Los PDF escaneados son imágenes; no contienen una capa de texto incrustada. El conversor producirá un archivo XML con elementos de página vacíos o casi vacíos. Si necesitas el texto de un documento escaneado, pásalo primero por la herramienta OCR PDF para incrustar una capa de texto y luego conviértelo a XML.

¿Puedo convertir páginas concretas en lugar de todo el archivo?

Sí. La herramienta incluye un selector de rango de páginas. Introduce una sola página, una lista separada por comas o un rango con guion (por ejemplo, 2-8) para limitar la conversión a esas páginas. Solo las páginas especificadas aparecen en el XML resultante, y sus atributos de número de página reflejan la numeración original del documento.

¿Mi archivo sale de mi dispositivo durante la conversión?

No. La conversión se ejecuta por completo en tu navegador mediante WebAssembly. Tu PDF se lee desde la memoria local, se analiza en el dispositivo y el XML resultante se genera y se descarga sin ninguna transferencia por red. Ningún archivo llega jamás a un servidor.