Cosa fa questa operazione
L’OCR riconosce caratteri su pagine raster. Il livello di testo aggiunto al PDF serve alla ricerca nel file che scaricate, non a costruire un indice presso Cifradocs. I file temporanei del riconoscimento durano minuti e comunque non oltre la retention. Il testo non è usato per addestrare modelli e non entra negli analitici. L’operazione è onerosa: sul piano gratuito può essere assente o fortemente limitata. La qualità dipende da scansione, lingua e contrasto: non si promette una sbobinatura da studio notarile.
Domande frequenti
Il testo riconosciuto resta in un database?
No. Serve al PDF ricercabile di uscita. I temporanei OCR sono rimossi. Non si tiene un corpus.
Usate l’OCR per addestrare un modello?
No. I documenti utente non alimentano addestramento.
Quanto resta il PDF ricercabile?
Come ogni elaborato: 60 minuti sul gratuito, al massimo 24 ore sui piani a pagamento. Poi cancellazione.
Le lingue dell’OCR coincidono con la lingua del sito?
No. I pacchetti di riconoscimento sono un parametro del lavoro, distinti dall’interfaccia in italiano.