Como extrair texto de um PDF escaneado com OCR, grátis no navegador
Publicado em 18 de setembro de 2026
Para extrair texto de um PDF escaneado, use OCR: escolha o idioma, clique em "Reconhecer e baixar" e receba um .txt. Grátis, no navegador, sem enviar o arquivo.
Como extrair texto de um PDF escaneado
Um PDF escaneado é uma foto da página, então o texto precisa ser reconhecido, não copiado. O OCR da AtlasDocs lê cada página no seu navegador, identifica as letras e devolve um arquivo .txt com o texto de todas as páginas, pronto para copiar, buscar ou colar no Word. O PDF original não é alterado: você recebe o texto num arquivo separado.
- Abra a ferramenta de OCR e envie o PDF escaneado ou a foto do documento (JPG, PNG, WebP ou GIF). Pode enviar vários arquivos de uma vez.
- Escolha o idioma do documento no menu junto ao botão (ele já vem em Português): Português, English ou Español. Idioma errado troca acentos e confunde letras parecidas.
- Clique em "Reconhecer e baixar" (com vários arquivos, o botão vira "Reconhecer 3 arquivos"). Aparece a mensagem "Reconhecendo… (pode levar um tempo)" enquanto o navegador lê página por página.
- Receba um arquivo .txt por documento, com o mesmo nome do original. O texto vem na ordem das páginas, sem marcação de onde cada uma começa; abra no Bloco de Notas ou no Word e revise.
Na primeira vez, o navegador baixa o programa de leitura e o modelo do idioma escolhido (alguns megabytes) antes de começar; nas vezes seguintes eles já estão guardados no aparelho e o reconhecimento começa bem mais rápido. Trocar de idioma baixa o modelo daquele idioma na primeira vez. PDFs longos levam alguns minutos, porque cada página é convertida em imagem ampliada e lida uma a uma. Se nada for reconhecido, a ferramenta mostra um aviso em vermelho de que não achou texto: confira se a digitalização está nítida e se o idioma está certo.
O que é OCR e por que você precisa dele
OCR quer dizer reconhecimento óptico de caracteres. É o que permite olhar para a imagem de um texto e descobrir quais são as letras. Para o computador, um PDF escaneado ou uma foto de documento é só um desenho: não há palavras dentro dele. O OCR percorre a imagem, identifica cada caractere e monta um texto de verdade, que você pode selecionar, copiar e editar em qualquer programa.
Como saber se o PDF é escaneado (e qual ferramenta usar)
Existem dois tipos de PDF que parecem iguais na tela. O primeiro nasceu digital (foi exportado do Word, por exemplo) e já tem texto de verdade dentro: você consegue selecionar uma palavra com o cursor. O segundo é uma imagem, vinda de um scanner ou de uma foto, e nada é selecionável, por mais nítido que esteja. É neste segundo caso que o OCR entra: ele lê a imagem e devolve o texto num arquivo .txt separado. Se o que você quer é o documento no Word, com a formatação da página, e não só o texto, veja como converter PDF em Word mantendo a formatação.
- Se você consegue clicar e arrastar para selecionar uma palavra, o PDF já tem texto. Não use OCR: a ferramenta Extrair texto de PDF salva todo o texto num .txt de uma vez, em segundos, sem adivinhar letra por letra. Se ela avisar que o PDF não contém texto extraível, ele é digitalizado: aí o caminho é o OCR.
- Se ao tentar selecionar você marca a página inteira como um bloco, é um documento digitalizado e o OCR é o caminho.
- Fotos de documentos tiradas pelo celular (JPG, PNG, WebP, GIF) também são imagens e funcionam com OCR.
- HEIC (o formato de foto do iPhone), TIFF, BMP e AVIF não entram no OCR: converta antes para JPG ou PNG e depois envie.
Se a foto veio do iPhone em HEIC, converta-a primeiro com a ferramenta HEIC para JPG, que também roda no navegador; imagens TIFF ou AVIF passam pela ferramenta TIFF/AVIF para JPG, e BMP, pela ferramenta Converter BMP para JPG, PNG ou WebP. Atenção: de um TIFF com várias páginas, como os que alguns scanners geram, só a primeira página é convertida. Em seguida envie o JPG resultante ao OCR.
HEIC para JPG →TIFF/AVIF para JPG →O OCR mantém a formatação ou gera um PDF pesquisável?
- Não gera um PDF pesquisável: o PDF original continua como estava, sem texto que dê para buscar. Se precisa de um PDF com o texto, transforme o .txt com a ferramenta Converter texto em PDF; o novo arquivo traz só o texto, sem a aparência da página escaneada.
- Não mantém a formatação: negrito, colunas e tabelas viram texto corrido. Números e nomes próprios são os que mais escapam; confira depois.
- Entrada: PDF e imagens .jpg, .jpeg, .png, .webp e .gif. Vários arquivos por vez.
- Saída: um arquivo de texto simples (.txt) para cada arquivo enviado, com o texto de todas as páginas na ordem do documento.
- Idiomas: Português, English e Español, um por execução. Documento com dois idiomas: rode duas vezes, um idioma de cada vez, e aproveite o melhor trecho de cada leitura.
Por que o OCR erra letras e como melhorar o resultado
- Prefira digitalizações nítidas e bem iluminadas; sombra, desfoque e reflexo atrapalham a leitura.
- Deixe o documento o mais reto possível: páginas tortas confundem o reconhecimento das linhas.
- Escolha o idioma certo antes de clicar: é o seletor que decide como acentos e cedilhas serão interpretados.
- Confira nomes, datas e números depois de baixar; são os detalhes que mais escapam, principalmente em fotos tremidas.
O OCR da AtlasDocs roda dentro do seu navegador: o documento nunca é enviado a nenhum servidor. Da internet só vêm as peças da própria ferramenta, o programa de leitura e o modelo de idioma, que ficam guardados no seu aparelho. Ideal para papéis com dados pessoais.
