OCR em linguagem simples
OCR significa Optical Character Recognition, ou reconhecimento óptico de caracteres. A tecnologia analisa uma imagem que contém escrita e tenta identificar os caracteres presentes nela.
Isso é especialmente útil em documentos digitalizados, fotografias de páginas e PDFs nos quais o texto não pode ser selecionado.
PDF com imagem x PDF pesquisável
Imagine uma folha de papel digitalizada. Visualmente, ela contém palavras, mas para o computador aquela página pode ser apenas uma imagem. O OCR cria uma representação textual que permite localizar termos e, em determinados fluxos, editar o conteúdo reconhecido.
Um PDF pesquisável melhora a recuperação de informação porque você pode procurar uma palavra sem precisar ler todas as páginas.
O que pode afetar o resultado
Qualidade da imagem, resolução, contraste, inclinação, manchas, fontes incomuns e escrita manual podem interferir no reconhecimento. Documentos limpos e bem digitalizados tendem a produzir resultados melhores.
Por isso, resultados de OCR devem ser revisados, principalmente quando o documento contém números, códigos, nomes próprios ou informações jurídicas e financeiras.
Quando usar
Use OCR quando o objetivo for tornar uma digitalização pesquisável, recuperar texto de uma imagem ou iniciar uma edição em um documento que não possui uma camada de texto utilizável.
Quer fazer isso agora?
Abra o editor gratuito do EditaPDF e trabalhe com seu documento diretamente no navegador.
Abrir o editor