Como converter um PDF em texto
- Adicione o PDF. Arraste o arquivo para a caixa acima ou toque nela para escolher.
- Defina as páginas. Deixe Todas as páginas ou toque em Escolher páginas e digite o que você quer, por exemplo 1-3, 5 ou 8-.
- Marque as quebras de página, se precisar. Ative Marcar onde começa cada página para inserir uma linha como ----- Página 3 ----- antes de cada página.
- Toque em Extrair texto. Uma barra de progresso mostra qual página está sendo lida.
- Copie ou salve. Use Copiar para colar o texto em outro lugar ou Baixar .txt para salvar um arquivo de texto em UTF-8.
Recursos
- Texto fácil de ler. As palavras são reorganizadas em linhas, e uma linha em branco separa os parágrafos (quando o espaçamento da página indica isso) e as páginas.
- Duas colunas sem bagunça. Cada coluna é lida inteira antes da próxima, em vez de misturar as duas linha a linha. Títulos que atravessam as duas colunas ficam no lugar certo.
- Tabelas separadas por tabulação, para colar as linhas numa planilha sem trabalho extra.
- Intervalos de páginas, inclusive abertos, como 8- para “da página 8 até o fim”.
- Marcadores de página opcionais, que podem ser ligados ou desligados depois da extração sem ler o arquivo de novo.
- Contagem rápida de caracteres, palavras e páginas acima do texto.
- Detecção de páginas digitalizadas, com a lista das páginas que precisam de OCR.
- Suporte a escrita da direita para a esquerda, como árabe, urdu, persa e hebraico.
Por que usar o Fileora para tirar o texto de um PDF
Selecionar texto direto no leitor de PDF costuma dar dor de cabeça. A seleção pula de uma coluna para outra, as quebras de linha caem no meio das frases e, no celular, muitas vezes não dá para selecionar mais que um parágrafo. Extraindo o documento inteiro de uma vez, você recebe um texto limpo para citar, traduzir, pesquisar, resumir ou reaproveitar num trabalho da faculdade.
O Fileora lê o PDF dentro do navegador, então contratos, extratos bancários, apostilas e provas não passam por servidor nenhum. Não tem cadastro, marca d'água nem limite de páginas, e funciona igual no celular e no computador. Com o texto em mãos, cole no contador de palavras para ver o tamanho e o tempo de leitura.
Quando o texto não aparece
Um PDF pode parecer texto na tela e, na verdade, guardar só imagens. É o caso de documentos escaneados pelo celular, cópias de cartório digitalizadas e faxes salvos em PDF. Quando nenhuma página tem texto, a ferramenta avisa; quando só algumas são digitalizadas, ela diz os números. Para ler essas páginas, converta com Converter PDF em JPG e passe as imagens pelo Imagem em Texto (OCR), que reconhece português.
Se o arquivo pedir senha, ele está criptografado. Abra com Desbloquear PDF usando a senha que você conhece e tente de novo.
Alguns PDFs usam fontes sem um mapa de caracteres adequado. O texto parece certo na tela, mas sai como símbolos estranhos ou nem sai. Não existe um jeito confiável de recuperar esses caracteres a partir do próprio arquivo, então aqui também a saída é o OCR.
O que esperar do resultado
O resultado é texto puro: negrito, itálico, cores, links e imagens ficam de fora. Cabeçalhos, rodapés e números de página fazem parte do texto da página, então aparecem também. Palavras separadas por hífen no fim da linha continuam separadas. Layouts muito complexos, como páginas de revista com caixas de texto e legendas espalhadas em volta das fotos, podem sair numa ordem inesperada, porque a sequência de leitura é reconstruída a partir da posição das palavras na página. Uma revisão rápida antes de usar o texto resolve a maioria desses casos.