PDF Tools
All tools, free, in your browser.
Convertire PDF in XML gratis online
Esporta il contenuto testuale di un PDF come XML strutturato con numeri di pagina e coordinate. Supporta la selezione dell'intervallo di pagine.
Come convertire un PDF in XML online
- Fai clic su Scegli file o trascina il tuo PDF nell'area di caricamento.
- Se vuoi, imposta un intervallo di pagine se ti serve solo una parte del documento.
- Fai clic su Converti in XML e attendi mentre pdf.js analizza il testo e le coordinate di ogni pagina.
- Scarica il file
.xmldirettamente sul tuo dispositivo, senza registrazione.
Com'è la struttura XML e cosa cattura
Il risultato è un documento XML UTF-8 ben formato. Un elemento radice <document> contiene un elemento figlio <page number="N"> per ogni pagina convertita. All'interno di ogni pagina, gli elementi <text> contengono il contenuto testuale estratto insieme agli attributi x, y, width e height che rappresentano il riquadro di delimitazione in unità utente PDF. Questo rende il risultato leggibile dalla macchina senza ulteriori trasformazioni: puoi interrogarlo con XPath, caricarlo in un parser DOM o elaborarlo con un foglio di stile XSLT. Un avvertimento importante: il convertitore si basa sul livello di testo incorporato nel PDF. I PDF composti solo da immagini o tracciati disegnati, senza oggetti di testo, produrranno uno scheletro XML con contenuto testuale vuoto. I documenti scansionati rientrano in questa categoria e richiedono prima un passaggio di OCR.
Quando usare la conversione da PDF a XML
Questo strumento si adatta a qualsiasi flusso di lavoro che debba trattare un PDF come dati strutturati anziché come un artefatto visivo fisso. Gli scenari tipici includono: importare il testo di contratti o fatture in una pipeline di dati che prevede input XML; archiviare il contenuto dei documenti in un formato che resti analizzabile senza strumenti PDF; migrare grandi raccolte di documenti in un CMS o in un database che accetta feed XML; e controlli di qualità automatizzati in cui uno script verifica che le frasi o i titoli richiesti compaiano alle coordinate previste. L'opzione dell'intervallo di pagine è particolarmente utile quando solo una sezione specifica di un lungo report contiene i dati che ti servono, riducendo i tempi di analisi e mantenendo piccolo il file di output.
Domande frequenti
- Cosa contiene effettivamente l'XML prodotto?
L'XML prodotto racchiude il documento in un elemento radice, quindi raggruppa il contenuto per pagina. Ogni elemento di pagina porta un attributo di numero e contiene elementi figli di blocchi di testo. Ogni blocco di testo registra la stringa estratta insieme alle sue coordinate x/y e alle dimensioni del riquadro di delimitazione come attributi, così puoi ricostruire programmaticamente l'ordine di lettura approssimativo o la disposizione spaziale.
- Lo strumento conserva la struttura del documento o si limita a riversare testo grezzo?
Lo strumento va oltre un semplice riversamento di testo. pdf.js viene usato per estrarre gli elementi di testo con la loro posizione su ogni pagina, e tali elementi vengono serializzati come elementi XML strutturati con metadati di coordinate. I titoli e il corpo del testo non vengono distinti semanticamente nel risultato — questa classificazione richiederebbe una post-elaborazione euristica da parte tua —, ma i dati spaziali sono presenti per supportarla.
- Funziona con un PDF scansionato?
Solo in parte. I PDF scansionati sono immagini; non contengono un livello di testo incorporato. Il convertitore produrrà un file XML con elementi di pagina vuoti o quasi vuoti. Se ti serve il testo di un documento scansionato, elaboralo prima con lo strumento OCR PDF per incorporare un livello di testo, poi convertilo in XML.
- Posso convertire pagine specifiche invece dell'intero file?
Sì. Lo strumento include un selettore di intervallo di pagine. Inserisci una singola pagina, un elenco separato da virgole o un intervallo con un trattino (ad esempio, 2-8) per limitare la conversione a quelle pagine. Solo le pagine specificate compaiono nell'XML prodotto, e i loro attributi di numero di pagina riflettono la numerazione originale del documento.
- Il mio file lascia il mio dispositivo durante la conversione?
No. La conversione avviene interamente nel tuo browser tramite WebAssembly. Il tuo PDF viene letto dalla memoria locale, analizzato sul dispositivo, e l'XML prodotto viene assemblato e scaricato senza alcun trasferimento di rete. Nessun file raggiunge mai un server.