Para convertir un PDF a texto, suelta el archivo en la herramienta PDF a texto de Krawly y elige el idioma del documento (hasta 3). Las páginas que ya contienen texto se extraen al instante; las escaneadas se procesan a 300 DPI y se leen con el OCR de Tesseract. Obtienes texto plano con separadores de página, para copiar o descargar como .txt. El PDF nunca sale de tu dispositivo.
Cómo usar la herramienta PDF a texto (OCR)
- 1
Abre tu PDF
Arrastra un PDF a la zona de carga o haz clic para elegirlo. Si el archivo está protegido con contraseña, la herramienta te la pide; solo se usa en tu navegador para abrir el documento.
- 2
Selecciona el idioma del documento
El inglés es el idioma predeterminado. Elige el idioma del texto escaneado, o hasta tres idiomas para documentos que los mezclan. La elección solo afecta a las páginas que necesitan OCR.
- 3
Decide si forzar el OCR
Deja desactivado «Forzar OCR en todas las páginas» para el uso normal. Actívalo si una extracción anterior dio caracteres sin sentido, para que todas las páginas se procesen y se lean con OCR en lugar de fiarse del texto incrustado.
- 4
Extrae el texto
Pulsa «Extraer texto». Las páginas con capa de texto terminan casi al instante; las páginas que son solo imagen tardan más porque se procesan y se reconocen en tu dispositivo. El resultado indica qué páginas pasaron por OCR.
- 5
Copia o descarga el .txt
El texto aparece con un separador --- Page N --- antes de cada página. Cópialo al portapapeles o descárgalo como archivo .txt.
PDF digitales y escaneados: por qué se revisa primero la capa de texto
No todos los PDF guardan el texto de la misma manera. Un PDF exportado desde un procesador de textos, un navegador o un programa de contabilidad suele incluir una capa de texto: los caracteres reales, sus fuentes y su posición en la página. Un PDF escaneado, o uno creado a partir de fotos del móvil, es distinto. Cada página es solo una imagen, así que intentar copiar texto de un PDF así no funciona: no hay caracteres que copiar y seleccionar texto en un visor de PDF no hace nada.
Krawly gestiona ambos casos en una sola pasada. En cada página usa primero PDF.js, la biblioteca de PDF de Mozilla, para buscar una capa de texto incrustada. Si la página la tiene, el texto se extrae directamente. Es exacto, porque lee los caracteres que el documento ya contiene, y casi instantáneo. Solo las páginas sin capa de texto se convierten en imagen a 300 DPI y se pasan al motor OCR Tesseract en el idioma que hayas seleccionado.
Esto importa en los documentos mixtos, que son más habituales de lo que parece: un contrato con una página de firmas escaneada, un informe con anexos fotocopiados o un formulario que se imprimió, se rellenó a mano y se volvió a escanear. Leer la capa de texto cuando existe evita introducir errores de OCR en páginas que ya estaban perfectas y ahorra tiempo en documentos largos. El resultado te indica qué páginas pasaron por OCR, para que sepas dónde revisar.
Cuándo usar «Forzar OCR» si el texto del PDF sale ilegible
A veces un PDF tiene capa de texto, pero lo que se extrae no tiene sentido: símbolos aleatorios, letras desordenadas, espacios que faltan o cuadros en lugar de letras con tilde. Suele deberse a cómo se generó el PDF. Algunos generadores incrustan las fuentes sin una correspondencia correcta entre glifos y caracteres, y algunos programas de escaneo añaden encima de la imagen de la página una capa OCR invisible de mala calidad.
En esos casos, activa «Forzar OCR en todas las páginas». La herramienta ignora entonces el texto incrustado, procesa cada página a 300 DPI y lee lo que se ve impreso en ella. Cambias velocidad por fiabilidad: aplicar OCR a todas las páginas tarda bastante más que leer una capa de texto, sobre todo en un móvil, pero el resultado refleja lo que realmente ves en pantalla.
«Forzar OCR» no hace falta con los PDF digitales normales. Si el texto extraído se ve limpio, la capa de texto es la fuente más precisa, porque contiene los caracteres exactos y no una interpretación de píxeles.
Extraer texto de documentos multilingües y con alfabetos no latinos
El OCR lee las páginas escaneadas con un modelo de idioma, así que el ajuste de idioma es importante en cualquier página que necesite OCR. Krawly admite inglés, español, portugués, francés, alemán, italiano, neerlandés, turco, polaco, ruso, ucraniano, árabe, hindi, japonés, chino (simplificado y tradicional), coreano, vietnamita e indonesio, y puedes combinar hasta tres. Un contrato en español con un anexo en inglés, o un documento en ucraniano con citas en ruso, debería tener ambos idiomas seleccionados.
A las páginas que ya tienen capa de texto no les afecta la elección de idioma, porque sus caracteres se leen directamente. Eso significa que un PDF digital en cualquier alfabeto, no solo en los idiomas de la lista, se puede extraer igualmente, siempre que el PDF guarde su texto correctamente.
Cada modelo de idioma se descarga la primera vez que lo seleccionas, unos pocos megabytes por idioma, y después tu navegador lo guarda en caché. Seleccionar solo los idiomas que realmente aparecen en el documento hace que la primera ejecución sea más corta.
Extracción de texto de PDF privada, sin subir nada
Los PDF de los que hay que extraer texto suelen ser los más delicados: extractos bancarios, nóminas, informes médicos, contratos firmados, formularios de impuestos y pasaportes escaneados. Con Krawly, todo el proceso se ejecuta en tu navegador con PDF.js y Tesseract.js compilados a WebAssembly. El PDF nunca se sube a los servidores de Krawly, y tampoco el texto extraído.
Tu navegador solo descarga archivos de programa, es decir, el motor OCR y los modelos de idioma. Si el PDF está protegido con contraseña, la contraseña se introduce y se usa en local para abrir el archivo. No se guarda nada y al cerrar la pestaña se descartan el documento y los resultados.
La contrapartida del procesamiento local es que la velocidad depende de tu dispositivo. Las páginas con capa de texto son rápidas en cualquier equipo, mientras que el OCR de muchas páginas escaneadas puede llevar un rato en un móvil antiguo. Se admiten PDF de hasta 200 MB, y la herramienta funciona en las versiones actuales de Chrome, Edge, Firefox y Safari, en escritorio y en móvil. Es un OCR de PDF gratis, sin registro y sin límite diario.
Consejos para obtener los mejores resultados
- Prueba primero una extracción normal. Activa «Forzar OCR» solo si el texto sale ilegible, porque aplicar OCR a todas las páginas es mucho más lento.
- Revisa las páginas marcadas como procesadas con OCR. Son las que pueden contener caracteres mal leídos; las páginas con capa de texto son exactas.
- Si de un escaneo largo solo necesitas unas pocas páginas, extráelas antes con Dividir PDF y pasa PDF a texto al archivo más pequeño.
- Selecciona todos los idiomas presentes en las páginas escaneadas, hasta tres, pero no más de los necesarios, para descargar menos modelos.
- Los PDF escaneados con páginas torcidas o muy tenues dan un OCR más flojo. Si puedes, vuelve a escanear a unos 300 DPI con la hoja bien plana.
- Los separadores --- Page N --- facilitan encontrar dónde empieza cada página cuando pegas el texto en otro documento.
Preguntas frecuentes
¿Puede convertir un PDF escaneado a texto?
Sí. Las páginas sin capa de texto, como escaneos o páginas fotografiadas, se procesan a 300 DPI y se leen con el motor OCR Tesseract en el idioma que elijas. Las páginas que ya contienen texto se extraen directamente. El resultado muestra qué páginas pasaron por OCR.
¿Hay un límite de páginas?
No hay un número fijo de páginas. Se admiten PDF de hasta 200 MB. En la práctica, el límite es el tiempo: las páginas con capa de texto son casi instantáneas, mientras que cada página escaneada necesita OCR en tu propio dispositivo, así que un documento escaneado largo puede tardar un rato, sobre todo en un móvil.
¿Por qué el texto extraído sale con caracteres raros?
Algunos PDF tienen una capa de texto defectuosa, a menudo porque las fuentes se incrustaron sin una correspondencia de caracteres correcta o porque al escanear se añadió una capa OCR de mala calidad. Activa «Forzar OCR en todas las páginas» y vuelve a ejecutar la conversión; la herramienta leerá entonces lo que se ve impreso.
¿Qué idiomas admite el OCR?
Inglés, español, portugués, francés, alemán, italiano, neerlandés, turco, polaco, ruso, ucraniano, árabe, hindi, japonés, chino (simplificado), chino (tradicional), coreano, vietnamita e indonesio, con hasta tres seleccionados a la vez. Las páginas con capa de texto incrustada se extraen directamente, sea cual sea su idioma.
¿Se sube mi PDF a algún sitio?
No. La extracción de texto y el OCR se ejecutan en tu navegador. Solo se descargan el motor OCR y los archivos de los modelos de idioma; el PDF, su contraseña si la tiene y el texto extraído se quedan en tu dispositivo. No se guarda nada y al cerrar la pestaña se borra todo.
¿Por qué el primer OCR tarda más?
La primera vez, tu navegador descarga el motor Tesseract y el modelo de cada idioma seleccionado, unos pocos megabytes por idioma, y los guarda en caché. Las siguientes ejecuciones reutilizan la caché y empiezan antes.
¿Conserva la maquetación, las tablas o las imágenes?
No. El resultado es texto plano con un separador --- Page N --- para cada página. No se conservan fuentes, columnas, tablas ni imágenes, y la herramienta no crea archivos de Word ni de Excel. Las columnas y tablas se aplanan en líneas de texto que quizá tengas que ordenar.
¿Puedo extraer texto de un PDF protegido con contraseña?
Sí, si conoces la contraseña. La herramienta te la pide al abrir el archivo y solo la usa en tu navegador para descifrar el documento. La contraseña no se envía a Krawly ni se guarda en ningún sitio.
Privado por diseño. Todos los conversores de Krawly funcionan dentro de tu navegador con JavaScript y WebAssembly. Tus archivos no se suben, no se guardan y nadie los ve: cuando cierras la pestaña, desaparecen.