Caratteri errati nelle proprietà del documento da file PDF

Se si hanno problemi con i valori delle proprietà del documento che vengono estratti dal file PDF utilizzando Plug-in RICOH ProcessDirector per Adobe Acrobat, i font inclusi nel file PDF potrebbero essere incompleti o contenere mappature UNICODE diverse da quelle che ci si aspetta.

Il processo di visualizzazione o stampa di contenuti utilizzando font su pagine PDF può utilizzare una varietà di codifiche. Il processo di estrazione del testo da una pagina PDF richiede una mappatura UNICODE da un carattere di pagina codificato ad un punto di codice Unicode.

Per estrarre il contenuto da PDF a UNICODE, i font includono una tabella che associa ogni carattere PDF al suo equivalente UNICODE. Alcuni font includono più caratteri simili. Per esempio, un font può includere un trattino, un segno meno e un trattino. Anche se sembrano molto simili, ognuno di essi è un carattere diverso e viene disegnato in modo leggermente diverso. Ognuno ha anche un codice UNICODE diverso. La tabella di mappatura determina quale carattere UNICODE viene utilizzato.

Quando RICOH ProcessDirector estrae i valori delle proprietà del documento da un file PDF utilizzando un file di controllo creato in Plug-in RICOH ProcessDirector per Adobe Acrobat, legge il valore in UNICODE. Quindi il valore viene registrato nel Document Properties File (DPF), che richiede la codifica dei dati nel formato UTF-8. Il formato UTF-8 utilizza sequenze di caratteri a più byte per rappresentare i punti di codice UNICODE al di fuori dell'intervallo di codifica ASCII. Come risultato, il valore viene convertito nel carattere equivalente UNICODE quando viene aggiunto al file DPF.

Possono verificarsi problemi quando i valori del DPF vengono scritti nuovamente nel file PDF. Se i caratteri UNICODE non hanno equivalenti PDF nel font, vengono inseriti caratteri errati. Questi problemi si verificano più spesso con i font sottoinsieme e Identity-H. Ulteriori problemi possono verificarsi quando si cercano caratteri espliciti, ma i punti di codice UNICODE nel DPF non sono i caratteri previsti.

La soluzione ideale è quella di aggiornare il file PDF di input in modo che includa font completi invece che sottoinsiemi. Un'altra opzione è quella di aggiungere al flusso di lavoro un passaggio che corregga le proprietà del DPF. RICOH ProcessDirector fornisce uno script Perl chiamato native2ascii.pl che può essere utilizzato per normalizzare il file DPF in una codifica di caratteri ASCII. I codepoint UNICODE che sono stati codificati come UTF-8, sono normalizzati in una forma \u####. Un editor o uno script filtro può essere utilizzato per cambiare il carattere del problema da UNICODE \u#### al carattere ASCII effettivamente richiesto. Una volta aggiornata la versione ASCII del DPF, utilizzi native2ascii.pl per riconvertire il DPF nella codifica UTF-8 richiesta.

Lo script native2ascii.pl converte il testo in Unicode Latin-1. Lo script è memorizzato in /aiw/aiw1/bin.

Per vedere le istruzioni per l'utilizzo dello script, apra un prompt dei comandi sul computer primario e digiti: native2ascii.pl -h