Primeiro: descubra que tipo de PDF você tem
Um PDF pode guardar caracteres, imagens ou uma combinação dos dois. Em um documento criado a partir de Word ou outro editor, normalmente existe uma camada de texto. Já uma página digitalizada pode ser apenas uma fotografia ou imagem.
Essa diferença é fundamental. Um editor pode localizar texto nativo diretamente; uma imagem precisa passar por reconhecimento de caracteres antes de se tornar pesquisável e editável.
Texto nativo
No texto nativo, palavras e caracteres possuem posições e informações próprias dentro da página. A edição pode então trabalhar sobre esses elementos, preservando a estrutura visual tanto quanto possível.
Mesmo assim, PDFs complexos podem conter fontes incorporadas, caixas de texto, tabelas ou elementos posicionados de maneiras diferentes. Por isso, sempre revise o resultado.
Quando usar OCR
Se você consegue ver as palavras, mas não consegue selecioná-las como texto, provavelmente está diante de uma imagem. O OCR analisa a imagem e identifica caracteres. O resultado pode ser usado para pesquisa e, dependendo do fluxo de edição, para alterações posteriores.
Boa prática
Nunca trate uma edição automática como substituta da revisão humana. Confira números, nomes, datas, valores monetários e termos técnicos depois de editar ou reconhecer um documento.
Quer fazer isso agora?
Abra o editor gratuito do EditaPDF e trabalhe com seu documento diretamente no navegador.
Abrir o editor