OCR Grátis · sem cadastro · sem marca d'água

Converter PDF em texto com OCR

Transformar PDF em texto funciona com qualquer PDF, inclusive documentos escaneados. A Krawly lê a camada de texto embutida onde ela existe e roda OCR nas páginas que são só imagem, tudo dentro do seu navegador.

Updated Krawly Editorial TeamIn-house engineers, writers & reviewers

ou solte um arquivo aqui

PDF · até 200 MB

Processado no seu navegador — os arquivos nunca são enviados

Resposta rápida

Para converter um PDF em texto, solte o arquivo na ferramenta PDF para Texto do Krawly e escolha o idioma do documento (até 3). Páginas que já contêm texto são extraídas na hora; páginas escaneadas são renderizadas a 300 DPI e lidas com o OCR do Tesseract. Você recebe texto simples com separadores de página, pronto para copiar ou baixar em .txt. O PDF nunca sai do seu aparelho.

Como usar a ferramenta PDF para Texto (OCR)

  1. 1

    Abra o PDF

    Arraste um PDF para a área de envio ou clique para escolher um. Se o arquivo tiver senha, a ferramenta pede a senha; ela é usada só no seu navegador para abrir o documento.

  2. 2

    Selecione o idioma do documento

    O inglês é o padrão. Escolha o idioma do texto escaneado, ou até três idiomas para documentos que misturam vários. A escolha só afeta as páginas que precisam de OCR.

  3. 3

    Decida se vai forçar o OCR

    Deixe “Forçar OCR em todas as páginas” desligado no uso normal. Ligue se uma extração anterior trouxe caracteres embaralhados, para que todas as páginas sejam renderizadas e lidas por OCR em vez de confiar no texto embutido.

  4. 4

    Extraia o texto

    Clique em Extrair texto. Páginas com camada de texto terminam quase na hora; páginas que são só imagem demoram mais, porque são renderizadas e reconhecidas no seu aparelho. O resultado indica quais páginas passaram por OCR.

  5. 5

    Copie ou baixe o .txt

    O texto aparece com um separador --- Page N --- antes de cada página. Copie para a área de transferência ou baixe como arquivo .txt.

PDF digital ou escaneado: por que a camada de texto é lida primeiro

Nem todo PDF guarda o texto do mesmo jeito. Um PDF exportado de um editor de texto, de um navegador ou de um sistema contábil normalmente tem uma camada de texto: os caracteres de verdade, suas fontes e suas posições na página. Um PDF escaneado, ou feito a partir de fotos do celular, é diferente. Cada página é só uma imagem, então não há caracteres para copiar, e tentar selecionar texto no leitor de PDF não dá em nada. É por isso que tanta gente não consegue copiar texto de PDF escaneado.

A Krawly resolve os dois casos de uma vez. Para cada página, ela usa primeiro o PDF.js, a biblioteca de PDF da Mozilla, para procurar uma camada de texto embutida. Se a página tiver uma, o texto é extraído diretamente. Isso é exato, porque lê os caracteres que o documento já contém, e é praticamente instantâneo. Só as páginas sem camada de texto são renderizadas como imagem a 300 DPI e passadas ao motor de OCR Tesseract no idioma que você escolheu.

Isso faz diferença em documentos mistos, que são mais comuns do que parece: um contrato com a página de assinatura escaneada, um relatório com anexos fotocopiados ou um formulário que foi impresso, preenchido e escaneado de volta. Ler a camada de texto onde ela existe evita colocar erros de OCR em páginas que já estavam perfeitas e economiza tempo em documentos longos. O resultado mostra quais páginas passaram por OCR, para você saber onde revisar.

Quando forçar o OCR em PDFs com texto embaralhado

Às vezes um PDF tem camada de texto, mas o que sai dela é um monte de nada: símbolos aleatórios, letras fora de ordem, espaços faltando ou quadradinhos no lugar de letras acentuadas. Isso normalmente vem de como o PDF foi gerado. Alguns geradores incorporam fontes sem um mapeamento correto dos glifos para os caracteres, e alguns programas de digitalização adicionam uma camada invisível de OCR de baixa qualidade por cima da imagem da página.

Nesses casos, ligue “Forçar OCR em todas as páginas”. A ferramenta passa a ignorar o texto embutido, renderiza cada página a 300 DPI e lê o que está visivelmente impresso nela. Você troca velocidade por confiabilidade: OCR em todas as páginas demora bem mais do que ler uma camada de texto, principalmente no celular, mas o resultado reflete o que você realmente vê na tela.

Forçar o OCR não é necessário em PDFs digitais comuns. Se o texto extraído estiver limpo, a camada de texto é a fonte mais precisa, porque contém os caracteres exatos, e não uma interpretação de pixels.

Extraindo texto de documentos em vários idiomas e alfabetos

O OCR lê páginas escaneadas com um modelo de idioma, então a configuração de idioma é importante para qualquer página que precise de OCR. A Krawly suporta inglês, espanhol, português, francês, alemão, italiano, holandês, turco, polonês, russo, ucraniano, árabe, hindi, japonês, chinês (simplificado e tradicional), coreano, vietnamita e indonésio, e você pode combinar até três deles. Um contrato em português com um anexo em inglês, ou um documento ucraniano com citações em russo, deve ter os dois idiomas selecionados.

Páginas que já têm camada de texto não são afetadas pela escolha de idioma, porque seus caracteres são lidos diretamente. Ou seja, dá para extrair texto de PDF digital em qualquer alfabeto, não só nos idiomas da lista, desde que o PDF guarde o texto corretamente.

Cada modelo de idioma é baixado na primeira vez que você o seleciona, alguns megabytes por idioma, e depois fica no cache do navegador. Selecionar só os idiomas que realmente aparecem no documento deixa a primeira execução mais curta.

Extração de texto de PDF privada, sem upload

Os PDFs que precisam de extração de texto muitas vezes são justamente os sensíveis: extratos bancários, holerites, laudos médicos, contratos assinados, declarações de imposto e passaportes escaneados. Com o Krawly, todo o processo roda no seu navegador usando PDF.js e Tesseract.js compilados para WebAssembly. O PDF nunca é enviado aos servidores do Krawly, e o texto extraído também não.

O navegador só baixa arquivos de programa, ou seja, o motor de OCR e os modelos de idioma. Se o PDF tiver senha, ela é digitada e usada localmente para abrir o arquivo. Nada é armazenado, e fechar a aba descarta o documento e os resultados.

A contrapartida do processamento local é que a velocidade depende do seu aparelho. Páginas com camada de texto são rápidas em qualquer lugar, enquanto o OCR de muitas páginas escaneadas pode demorar num celular mais antigo. PDFs de até 200 MB são aceitos, e a ferramenta funciona nas versões atuais do Chrome, Edge, Firefox e Safari, no computador e no celular. É grátis, sem cadastro e sem limite diário.

Dicas para os melhores resultados

  • Tente primeiro uma extração normal. Ligue Forçar OCR só se o texto sair embaralhado, já que o OCR em todas as páginas é bem mais lento.
  • Revise as páginas marcadas como lidas por OCR. São elas que podem ter caracteres errados; as páginas com camada de texto são exatas.
  • Num documento escaneado longo em que você só precisa de algumas páginas, use Dividir PDF para extrair essas páginas antes e rode PDF para Texto no arquivo menor.
  • Selecione todos os idiomas usados nas páginas escaneadas, até três, mas não mais do que o necessário, para que menos modelos precisem ser baixados.
  • PDFs escaneados com páginas tortas ou muito apagadas dão um OCR mais fraco. Se puder, digitalize de novo a uns 300 DPI com a folha bem plana.
  • Os separadores --- Page N --- facilitam achar onde cada página começa quando você cola o texto em outro documento.

Perguntas frequentes

Dá para converter um PDF escaneado em texto?

Sim. Páginas sem camada de texto, como digitalizações ou páginas fotografadas, são renderizadas a 300 DPI e lidas com o motor de OCR Tesseract no idioma que você escolher. Páginas que já contêm texto são extraídas diretamente. O resultado mostra quais páginas passaram por OCR.

Existe limite de páginas?

Não há um número fixo de páginas. PDFs de até 200 MB são aceitos. Na prática, o limite é o tempo: páginas com camada de texto são quase instantâneas, enquanto cada página escaneada precisa de OCR no seu próprio aparelho, então um documento escaneado longo pode demorar, principalmente no celular.

Por que o texto extraído saiu embaralhado?

Alguns PDFs têm uma camada de texto defeituosa, muitas vezes porque as fontes foram incorporadas sem um mapeamento correto de caracteres ou porque uma camada de OCR de baixa qualidade foi adicionada na digitalização. Ligue Forçar OCR em todas as páginas e rode a conversão de novo; a ferramenta vai ler o que está visivelmente impresso.

Quais idiomas são suportados no OCR?

Inglês, espanhol, português, francês, alemão, italiano, holandês, turco, polonês, russo, ucraniano, árabe, hindi, japonês, chinês (simplificado), chinês (tradicional), coreano, vietnamita e indonésio, com até três selecionados ao mesmo tempo. Páginas com camada de texto embutida são extraídas diretamente, seja qual for o idioma.

Meu PDF é enviado para algum lugar?

Não. A extração de texto e o OCR rodam no seu navegador. Só os arquivos do motor de OCR e dos modelos de idioma são baixados; o PDF, a senha dele se houver e o texto extraído ficam no seu aparelho. Nada é armazenado, e fechar a aba apaga tudo.

Por que o primeiro OCR é mais lento?

No primeiro uso, o navegador baixa o motor Tesseract e o modelo de cada idioma selecionado, alguns megabytes por idioma, e guarda em cache. As próximas execuções reaproveitam o cache e começam mais rápido.

O layout, as tabelas ou as imagens são mantidos?

Não. O resultado é texto simples, com um separador --- Page N --- para cada página. Fontes, colunas, tabelas e imagens não são preservadas, e a ferramenta não cria arquivos do Word nem do Excel. Colunas e tabelas viram linhas de texto que talvez precisem ser arrumadas.

Dá para extrair texto de um PDF protegido por senha?

Sim, se você souber a senha. A ferramenta pede a senha ao abrir o arquivo e a usa só no seu navegador para descriptografar o documento. A senha não é enviada para o Krawly nem salva em lugar nenhum.

Privado por padrão. Todos os conversores do Krawly rodam dentro do seu navegador com JavaScript e WebAssembly. Seus arquivos não são enviados, armazenados nem vistos por ninguém — ao fechar a aba, eles somem.

Conversores relacionados

Ver todos os 21 conversores grátis