Sobre o PDF para texto
Retira o texto simples de um PDF para você reutilizar — colar em um documento ou e-mail, citar um relatório, jogar em um tradutor ou app de notas, ou remover a formatação para ficar só com as palavras. Ele lê o texto como está armazenado no arquivo, página por página, e entrega o resultado para copiar ou baixar como .txt.
A extração roda no seu dispositivo, então até documentos confidenciais permanecem privados.
Como funciona
O PDF é aberto com o pdf.js no seu navegador. Para cada página, a ferramenta lê a camada de texto da página — os dados reais de caractere e posição que o PDF armazena — e a acrescenta, separando as páginas com uma linha em branco. Ele exibe o texto conforme avança, então você o vê preencher página por página, e mostra um status "página X de N". Nada é redigitado ou adivinhado; ele revela o texto que realmente está no arquivo.
Suposições e padrões
- Ele lê a camada de texto incorporada, então os resultados dependem de como o PDF foi feito. Um PDF exportado do Word, de um navegador ou da maioria dos softwares tem uma camada de texto limpa; um PDF digitalizado ou só de imagem não tem nenhuma.
- As páginas são exibidas na ordem do documento, separadas por uma linha em branco.
- O download é um
.txtde texto simples com o nome do PDF de origem. - Se nenhum texto selecionável for encontrado, a ferramenta avisa explicitamente que o PDF parece digitalizado e precisaria de OCR.
Limitações
- Sem OCR. Ele lê o texto existente; não reconhece texto dentro de imagens ou fotos digitalizadas. Se o PDF for uma digitalização, você terá um resultado vazio e um aviso de que é preciso OCR — esta ferramenta não faz essa etapa.
- O layout não é totalmente reconstruído. O texto sai na ordem em que o PDF o armazena, o que costuma ser correto para documentos de uma coluna, mas pode intercalar ou desordenar colunas, tabelas, cabeçalhos/rodapés e caixas de texto em layouts complexos.
- A formatação é descartada — você recebe texto simples, não fontes, negrito/itálico, títulos ou estrutura de tabelas.
- PDFs criptografados ou corrompidos não podem ser lidos e mostrarão um erro.
Privacidade
O texto é extraído com o pdf.js inteiramente no seu navegador. Seu PDF e seu texto nunca saem do seu dispositivo — nada é enviado ou armazenado.

