Pular para o conteúdo

Converter PDF em Texto – Extraia o Texto de Qualquer PDF

Pegue as palavras de um PDF como texto simples, pronto para copiar, editar ou salvar em .txt. O arquivo é lido no seu navegador e nunca sai do seu aparelho.

Como converter um PDF em texto

  1. Adicione o PDF. Arraste o arquivo para a caixa acima ou toque nela para escolher.
  2. Defina as páginas. Deixe Todas as páginas ou toque em Escolher páginas e digite o que você quer, por exemplo 1-3, 5 ou 8-.
  3. Marque as quebras de página, se precisar. Ative Marcar onde começa cada página para inserir uma linha como ----- Página 3 ----- antes de cada página.
  4. Toque em Extrair texto. Uma barra de progresso mostra qual página está sendo lida.
  5. Copie ou salve. Use Copiar para colar o texto em outro lugar ou Baixar .txt para salvar um arquivo de texto em UTF-8.

Recursos

  • Texto fácil de ler. As palavras são reorganizadas em linhas, e uma linha em branco separa os parágrafos (quando o espaçamento da página indica isso) e as páginas.
  • Duas colunas sem bagunça. Cada coluna é lida inteira antes da próxima, em vez de misturar as duas linha a linha. Títulos que atravessam as duas colunas ficam no lugar certo.
  • Tabelas separadas por tabulação, para colar as linhas numa planilha sem trabalho extra.
  • Intervalos de páginas, inclusive abertos, como 8- para “da página 8 até o fim”.
  • Marcadores de página opcionais, que podem ser ligados ou desligados depois da extração sem ler o arquivo de novo.
  • Contagem rápida de caracteres, palavras e páginas acima do texto.
  • Detecção de páginas digitalizadas, com a lista das páginas que precisam de OCR.
  • Suporte a escrita da direita para a esquerda, como árabe, urdu, persa e hebraico.

Por que usar o Fileora para tirar o texto de um PDF

Selecionar texto direto no leitor de PDF costuma dar dor de cabeça. A seleção pula de uma coluna para outra, as quebras de linha caem no meio das frases e, no celular, muitas vezes não dá para selecionar mais que um parágrafo. Extraindo o documento inteiro de uma vez, você recebe um texto limpo para citar, traduzir, pesquisar, resumir ou reaproveitar num trabalho da faculdade.

O Fileora lê o PDF dentro do navegador, então contratos, extratos bancários, apostilas e provas não passam por servidor nenhum. Não tem cadastro, marca d'água nem limite de páginas, e funciona igual no celular e no computador. Com o texto em mãos, cole no contador de palavras para ver o tamanho e o tempo de leitura.

Quando o texto não aparece

Um PDF pode parecer texto na tela e, na verdade, guardar só imagens. É o caso de documentos escaneados pelo celular, cópias de cartório digitalizadas e faxes salvos em PDF. Quando nenhuma página tem texto, a ferramenta avisa; quando só algumas são digitalizadas, ela diz os números. Para ler essas páginas, converta com Converter PDF em JPG e passe as imagens pelo Imagem em Texto (OCR), que reconhece português.

Se o arquivo pedir senha, ele está criptografado. Abra com Desbloquear PDF usando a senha que você conhece e tente de novo.

Alguns PDFs usam fontes sem um mapa de caracteres adequado. O texto parece certo na tela, mas sai como símbolos estranhos ou nem sai. Não existe um jeito confiável de recuperar esses caracteres a partir do próprio arquivo, então aqui também a saída é o OCR.

O que esperar do resultado

O resultado é texto puro: negrito, itálico, cores, links e imagens ficam de fora. Cabeçalhos, rodapés e números de página fazem parte do texto da página, então aparecem também. Palavras separadas por hífen no fim da linha continuam separadas. Layouts muito complexos, como páginas de revista com caixas de texto e legendas espalhadas em volta das fotos, podem sair numa ordem inesperada, porque a sequência de leitura é reconstruída a partir da posição das palavras na página. Uma revisão rápida antes de usar o texto resolve a maioria desses casos.

Perguntas frequentes

Como extrair o texto de um PDF?

Adicione o PDF, deixe Todas as páginas ou toque em Escolher páginas e depois em Extrair texto. O texto aparece numa caixa logo abaixo, com os botões Copiar e Baixar .txt.

Por que aparece que nenhum texto foi encontrado?

Quase sempre o PDF é uma digitalização: cada página é uma foto do texto, e não texto de verdade, então não há nada para extrair. Transforme as páginas em imagens com Converter PDF em JPG e leia essas imagens com Imagem em Texto (OCR). Se só algumas páginas forem digitalizadas, a ferramenta diz quais são e extrai o resto normalmente.

Dá para extrair o texto só de algumas páginas?

Dá. Toque em Escolher páginas e digite números e intervalos como 1-3, 5 ou 8-. Um intervalo sem fim, como 8-, vai até a última página. As páginas saem na ordem em que você digitou.

O layout do PDF é mantido?

As linhas, os parágrafos e a ordem de leitura são mantidos; fontes, cores, imagens e posições exatas, não. Páginas em duas colunas são lidas uma coluna depois da outra, e espaços largos dentro de uma linha, como entre células de tabela, viram tabulações.

Funciona com PDFs em árabe, urdu ou hebraico?

Funciona, desde que o PDF tenha texto real. As linhas escritas da direita para a esquerda são remontadas na ordem de leitura a partir da posição de cada palavra, e números e palavras em alfabeto latino mantêm a própria ordem. Vale conferir o resultado, porque alguns PDFs guardam letras ligadas de um jeito que pode sair trocado.

E se o PDF tiver senha?

Um PDF que pede senha para abrir não pode ser lido. Tire a senha antes com Desbloquear PDF e depois extraia o texto. PDFs que abrem sem senha, mas bloqueiam a cópia, são lidos normalmente.

Meu PDF é enviado para algum servidor?

Não. Quem extrai o texto é o seu próprio navegador, no seu aparelho. Nada é enviado, então contratos e documentos sigilosos continuam só com você.

Não encontrou a ferramenta que precisa ou algo não está funcionando?

Conte qual ferramenta você gostaria ou o que deu errado. Lemos todas as mensagens, e os pedidos decidem o que criamos a seguir.

Abre seu app de e-mail. Por favor, não anexe arquivos privados.