PDF Tools

All tools, free, in your browser.

VoxScan Strumenti PDF Converti da PDF Convertire PDF in XML gratis online

Convertire PDF in XML gratis online

Esporta il contenuto testuale di un PDF come XML strutturato con numeri di pagina e coordinate. Supporta la selezione dell'intervallo di pagine.

XML strutturatoDati di pagina e posizioneSeleziona pagineCodificato in UTF-8

Come convertire un PDF in XML online

  1. Fai clic su Scegli file o trascina il tuo PDF nell'area di caricamento.
  2. Se vuoi, imposta un intervallo di pagine se ti serve solo una parte del documento.
  3. Fai clic su Converti in XML e attendi mentre pdf.js analizza il testo e le coordinate di ogni pagina.
  4. Scarica il file .xml direttamente sul tuo dispositivo, senza registrazione.

Com'è la struttura XML e cosa cattura

Il risultato è un documento XML UTF-8 ben formato. Un elemento radice <document> contiene un elemento figlio <page number="N"> per ogni pagina convertita. All'interno di ogni pagina, gli elementi <text> contengono il contenuto testuale estratto insieme agli attributi x, y, width e height che rappresentano il riquadro di delimitazione in unità utente PDF. Questo rende il risultato leggibile dalla macchina senza ulteriori trasformazioni: puoi interrogarlo con XPath, caricarlo in un parser DOM o elaborarlo con un foglio di stile XSLT. Un avvertimento importante: il convertitore si basa sul livello di testo incorporato nel PDF. I PDF composti solo da immagini o tracciati disegnati, senza oggetti di testo, produrranno uno scheletro XML con contenuto testuale vuoto. I documenti scansionati rientrano in questa categoria e richiedono prima un passaggio di OCR.

Quando usare la conversione da PDF a XML

Questo strumento si adatta a qualsiasi flusso di lavoro che debba trattare un PDF come dati strutturati anziché come un artefatto visivo fisso. Gli scenari tipici includono: importare il testo di contratti o fatture in una pipeline di dati che prevede input XML; archiviare il contenuto dei documenti in un formato che resti analizzabile senza strumenti PDF; migrare grandi raccolte di documenti in un CMS o in un database che accetta feed XML; e controlli di qualità automatizzati in cui uno script verifica che le frasi o i titoli richiesti compaiano alle coordinate previste. L'opzione dell'intervallo di pagine è particolarmente utile quando solo una sezione specifica di un lungo report contiene i dati che ti servono, riducendo i tempi di analisi e mantenendo piccolo il file di output.

Domande frequenti

Cosa contiene effettivamente l'XML prodotto?

L'XML prodotto racchiude il documento in un elemento radice, quindi raggruppa il contenuto per pagina. Ogni elemento di pagina porta un attributo di numero e contiene elementi figli di blocchi di testo. Ogni blocco di testo registra la stringa estratta insieme alle sue coordinate x/y e alle dimensioni del riquadro di delimitazione come attributi, così puoi ricostruire programmaticamente l'ordine di lettura approssimativo o la disposizione spaziale.

Lo strumento conserva la struttura del documento o si limita a riversare testo grezzo?

Lo strumento va oltre un semplice riversamento di testo. pdf.js viene usato per estrarre gli elementi di testo con la loro posizione su ogni pagina, e tali elementi vengono serializzati come elementi XML strutturati con metadati di coordinate. I titoli e il corpo del testo non vengono distinti semanticamente nel risultato — questa classificazione richiederebbe una post-elaborazione euristica da parte tua —, ma i dati spaziali sono presenti per supportarla.

Funziona con un PDF scansionato?

Solo in parte. I PDF scansionati sono immagini; non contengono un livello di testo incorporato. Il convertitore produrrà un file XML con elementi di pagina vuoti o quasi vuoti. Se ti serve il testo di un documento scansionato, elaboralo prima con lo strumento OCR PDF per incorporare un livello di testo, poi convertilo in XML.

Posso convertire pagine specifiche invece dell'intero file?

Sì. Lo strumento include un selettore di intervallo di pagine. Inserisci una singola pagina, un elenco separato da virgole o un intervallo con un trattino (ad esempio, 2-8) per limitare la conversione a quelle pagine. Solo le pagine specificate compaiono nell'XML prodotto, e i loro attributi di numero di pagina riflettono la numerazione originale del documento.

Il mio file lascia il mio dispositivo durante la conversione?

No. La conversione avviene interamente nel tuo browser tramite WebAssembly. Il tuo PDF viene letto dalla memoria locale, analizzato sul dispositivo, e l'XML prodotto viene assemblato e scaricato senza alcun trasferimento di rete. Nessun file raggiunge mai un server.