Pular para o conteúdo
AtlasDocs
Blog

Como extrair texto de um PDF escaneado com OCR, grátis no navegador

Publicado em 18 de setembro de 2026

Para extrair texto de um PDF escaneado, use OCR: escolha o idioma, clique em "Reconhecer e baixar" e receba um .txt. Grátis, no navegador, sem enviar o arquivo.

Como extrair texto de um PDF escaneado

Um PDF escaneado é uma foto da página, então o texto precisa ser reconhecido, não copiado. O OCR da AtlasDocs lê cada página no seu navegador, identifica as letras e devolve um arquivo .txt com o texto de todas as páginas, pronto para copiar, buscar ou colar no Word. O PDF original não é alterado: você recebe o texto num arquivo separado.

  1. Abra a ferramenta de OCR e envie o PDF escaneado ou a foto do documento (JPG, PNG, WebP ou GIF). Pode enviar vários arquivos de uma vez.
  2. Escolha o idioma do documento no menu junto ao botão (ele já vem em Português): Português, English ou Español. Idioma errado troca acentos e confunde letras parecidas.
  3. Clique em "Reconhecer e baixar" (com vários arquivos, o botão vira "Reconhecer 3 arquivos"). Aparece a mensagem "Reconhecendo… (pode levar um tempo)" enquanto o navegador lê página por página.
  4. Receba um arquivo .txt por documento, com o mesmo nome do original. O texto vem na ordem das páginas, sem marcação de onde cada uma começa; abra no Bloco de Notas ou no Word e revise.
OCR: extrair texto de PDF escaneado e imagens

Na primeira vez, o navegador baixa o programa de leitura e o modelo do idioma escolhido (alguns megabytes) antes de começar; nas vezes seguintes eles já estão guardados no aparelho e o reconhecimento começa bem mais rápido. Trocar de idioma baixa o modelo daquele idioma na primeira vez. PDFs longos levam alguns minutos, porque cada página é convertida em imagem ampliada e lida uma a uma. Se nada for reconhecido, a ferramenta mostra um aviso em vermelho de que não achou texto: confira se a digitalização está nítida e se o idioma está certo.

O que é OCR e por que você precisa dele

OCR quer dizer reconhecimento óptico de caracteres. É o que permite olhar para a imagem de um texto e descobrir quais são as letras. Para o computador, um PDF escaneado ou uma foto de documento é só um desenho: não há palavras dentro dele. O OCR percorre a imagem, identifica cada caractere e monta um texto de verdade, que você pode selecionar, copiar e editar em qualquer programa.

Como saber se o PDF é escaneado (e qual ferramenta usar)

Existem dois tipos de PDF que parecem iguais na tela. O primeiro nasceu digital (foi exportado do Word, por exemplo) e já tem texto de verdade dentro: você consegue selecionar uma palavra com o cursor. O segundo é uma imagem, vinda de um scanner ou de uma foto, e nada é selecionável, por mais nítido que esteja. É neste segundo caso que o OCR entra: ele lê a imagem e devolve o texto num arquivo .txt separado. Se o que você quer é o documento no Word, com a formatação da página, e não só o texto, veja como converter PDF em Word mantendo a formatação.

  • Se você consegue clicar e arrastar para selecionar uma palavra, o PDF já tem texto. Não use OCR: a ferramenta Extrair texto de PDF salva todo o texto num .txt de uma vez, em segundos, sem adivinhar letra por letra. Se ela avisar que o PDF não contém texto extraível, ele é digitalizado: aí o caminho é o OCR.
  • Se ao tentar selecionar você marca a página inteira como um bloco, é um documento digitalizado e o OCR é o caminho.
  • Fotos de documentos tiradas pelo celular (JPG, PNG, WebP, GIF) também são imagens e funcionam com OCR.
  • HEIC (o formato de foto do iPhone), TIFF, BMP e AVIF não entram no OCR: converta antes para JPG ou PNG e depois envie.
Extrair texto de PDF

Se a foto veio do iPhone em HEIC, converta-a primeiro com a ferramenta HEIC para JPG, que também roda no navegador; imagens TIFF ou AVIF passam pela ferramenta TIFF/AVIF para JPG, e BMP, pela ferramenta Converter BMP para JPG, PNG ou WebP. Atenção: de um TIFF com várias páginas, como os que alguns scanners geram, só a primeira página é convertida. Em seguida envie o JPG resultante ao OCR.

HEIC para JPGTIFF/AVIF para JPG

O OCR mantém a formatação ou gera um PDF pesquisável?

  • Não gera um PDF pesquisável: o PDF original continua como estava, sem texto que dê para buscar. Se precisa de um PDF com o texto, transforme o .txt com a ferramenta Converter texto em PDF; o novo arquivo traz só o texto, sem a aparência da página escaneada.
  • Não mantém a formatação: negrito, colunas e tabelas viram texto corrido. Números e nomes próprios são os que mais escapam; confira depois.
  • Entrada: PDF e imagens .jpg, .jpeg, .png, .webp e .gif. Vários arquivos por vez.
  • Saída: um arquivo de texto simples (.txt) para cada arquivo enviado, com o texto de todas as páginas na ordem do documento.
  • Idiomas: Português, English e Español, um por execução. Documento com dois idiomas: rode duas vezes, um idioma de cada vez, e aproveite o melhor trecho de cada leitura.

Por que o OCR erra letras e como melhorar o resultado

  • Prefira digitalizações nítidas e bem iluminadas; sombra, desfoque e reflexo atrapalham a leitura.
  • Deixe o documento o mais reto possível: páginas tortas confundem o reconhecimento das linhas.
  • Escolha o idioma certo antes de clicar: é o seletor que decide como acentos e cedilhas serão interpretados.
  • Confira nomes, datas e números depois de baixar; são os detalhes que mais escapam, principalmente em fotos tremidas.

O OCR da AtlasDocs roda dentro do seu navegador: o documento nunca é enviado a nenhum servidor. Da internet só vêm as peças da própria ferramenta, o programa de leitura e o modelo de idioma, que ficam guardados no seu aparelho. Ideal para papéis com dados pessoais.