Cómo extraer texto de un PDF escaneado con OCR, gratis en el navegador
Publicado el 18 de septiembre de 2026
Para extraer texto de un PDF escaneado, usa OCR: elige el idioma, haz clic en "Reconocer y descargar" y recibe un .txt. Gratis, en el navegador y sin subir el archivo.
Cómo extraer texto de un PDF escaneado
Un PDF escaneado es una foto de la página, así que el texto hay que reconocerlo, no copiarlo. El OCR de AtlasDocs lee cada página en tu navegador, identifica las letras y devuelve un archivo .txt con el texto de todas las páginas, listo para copiar, buscar o pegar en Word. El PDF original no se modifica: recibes el texto en un archivo aparte.
- Abre la herramienta de OCR y sube el PDF escaneado o la foto del documento (JPG, PNG, WebP o GIF). Puedes subir varios archivos a la vez.
- Elige el idioma del documento en el menú junto al botón (viene en Português): Português, English o Español. Un idioma equivocado cambia las tildes y confunde letras parecidas.
- Haz clic en "Reconocer y descargar" (con varios archivos, el botón pasa a "Reconocer 3 archivos"). Aparece el mensaje "Reconociendo… (puede tardar)" mientras el navegador lee página por página.
- Recibe un archivo .txt por documento, con el mismo nombre que el original. El texto sigue el orden de las páginas, sin marca de dónde empieza cada una; ábrelo en el Bloc de notas o en Word y revísalo.
La primera vez, el navegador descarga el programa de lectura y el modelo del idioma elegido (unos pocos megabytes) antes de empezar; después ya quedan guardados en el dispositivo y el reconocimiento arranca mucho más rápido. Cambiar de idioma descarga el modelo de ese idioma la primera vez. Los PDF largos tardan unos minutos, porque cada página se convierte en una imagen ampliada y las páginas se leen una a una. Si no se reconoce nada, la herramienta muestra un aviso en rojo de que no encontró texto: comprueba que el escaneo sea nítido y que el idioma sea el correcto.
Qué es el OCR y por qué lo necesitas
OCR significa reconocimiento óptico de caracteres. Es lo que permite mirar la imagen de un texto y averiguar qué letras hay. Para el ordenador, un PDF escaneado o una foto de un documento es solo un dibujo: no hay palabras dentro. El OCR recorre la imagen, identifica cada carácter y arma un texto de verdad que puedes seleccionar, copiar y editar en cualquier programa.
Cómo saber si un PDF está escaneado (y qué herramienta usar)
Hay dos tipos de PDF que parecen iguales en pantalla. El primero nació digital (exportado desde Word, por ejemplo) y ya lleva texto de verdad dentro: puedes seleccionar una palabra con el cursor. El segundo es una imagen, procedente de un escáner o de una foto, y nada es seleccionable, por muy nítido que se vea. En este segundo caso entra el OCR: lee la imagen y devuelve el texto en un archivo .txt aparte. Si lo que quieres es el documento en Word, con el formato de la página y no solo el texto, mira cómo convertir PDF a Word manteniendo el formato.
- Si puedes hacer clic y arrastrar para seleccionar una palabra, el PDF ya tiene texto. No uses OCR: la herramienta Extraer texto de PDF guarda todo el texto en un .txt de una vez, en segundos y sin adivinar letra por letra. Si avisa que el PDF no contiene texto extraíble, es un documento escaneado: entonces el camino es el OCR.
- Si al intentar seleccionar se marca la página entera como un bloque, es un documento digitalizado y el OCR es el camino.
- Las fotos de documentos hechas con el móvil (JPG, PNG, WebP, GIF) también son imágenes y funcionan con OCR.
- HEIC (el formato de foto del iPhone), TIFF, BMP y AVIF no son compatibles con el OCR: conviértelos antes a JPG o PNG y luego súbelos.
Si la foto viene del iPhone en HEIC, conviértela primero con la herramienta HEIC a JPG, que también funciona en el navegador; las imágenes TIFF o AVIF pasan por la herramienta TIFF/AVIF a JPG, y las BMP por la herramienta Convertir BMP a JPG, PNG o WebP. Atención: de un TIFF con varias páginas, como los que generan algunos escáneres, solo se convierte la primera página. Después sube el JPG resultante al OCR.
HEIC a JPG →TIFF/AVIF a JPG →¿El OCR conserva el formato o crea un PDF buscable?
- No genera un PDF buscable: el PDF original queda como estaba, sin texto que se pueda buscar. Si necesitas un PDF con el texto, convierte el .txt con la herramienta Convertir texto a PDF; el nuevo archivo trae solo el texto, sin el aspecto de la página escaneada.
- No conserva el formato: negritas, columnas y tablas se convierten en texto corrido. En los números y los nombres propios es donde más errores se cuelan; revísalos después.
- Entrada: PDF e imágenes .jpg, .jpeg, .png, .webp y .gif. Varios archivos a la vez.
- Salida: un archivo de texto plano (.txt) por cada archivo que subes, con el texto de todas las páginas en el orden del documento.
- Idiomas: Português, English y Español, uno por ejecución. Documento en dos idiomas: ejecútalo dos veces, un idioma cada vez, y quédate con el mejor fragmento de cada una.
Por qué el OCR confunde letras y cómo mejorar el resultado
- Usa escaneos nítidos y bien iluminados; la sombra, el desenfoque y los reflejos dificultan la lectura.
- Deja el documento lo más recto posible: las páginas torcidas confunden la detección de líneas.
- Elige el idioma correcto antes de hacer clic: el selector decide cómo se interpretan tildes y eñes.
- Revisa nombres, fechas y números después de descargar; son los detalles donde más errores se cuelan, sobre todo en fotos movidas.
El OCR de AtlasDocs se ejecuta dentro de tu navegador: el documento nunca se envía a ningún servidor. Lo único que se descarga son las piezas de la propia herramienta, el programa de lectura y el modelo de idioma, que se quedan en tu dispositivo. Ideal para papeles con datos personales.
