FerramentasTodas as ferramentas

Arquivo

Extrair texto de PDF já normalizado para leitura

Extrai o texto de um PDF e aplica limpeza opcional por tipo: remove cabeçalho e rodapé repetidos entre páginas, junta linha quebrada no meio de frase, remove número de página solto, corrige hifenização de fim de linha e normaliza espaço — com relatório do que foi alterado.

Clique para escolher um PDF

Até 50 MB, sem proteção por senha

Tipos de limpeza

Processamento local: seu arquivo não sai do seu computador.

O texto de um PDF nunca sai limpo de verdade

Um PDF guarda texto de um jeito otimizado para exibição visual, não para leitura sequencial — cada linha é posicionada por coordenada na página, sem necessariamente carregar a informação de que duas linhas fazem parte do mesmo parágrafo. Extrair o texto "cru" de um PDF, sem tratamento nenhum, normalmente produz um resultado cheio de quebra de linha no meio de frase, cabeçalho e rodapé repetidos em toda página, e número de página solto misturado ao conteúdo. Esta ferramenta extrai o texto e aplica, por cima, uma série de correções para aproximar o resultado de um texto corrido normal.

Como o cabeçalho e o rodapé repetido são identificados

Documentos com cabeçalho ou rodapé fixo repetem a mesma linha (ou quase a mesma, quando um número de página muda dentro do rodapé) no início ou no fim de praticamente toda página. A ferramenta observa as duas primeiras e as duas últimas linhas de cada página e, quando uma forma se repete em pelo menos metade do documento, remove essa linha de todas as páginas onde aparece. Números dentro da linha são ignorados na comparação — assim, um rodapé como "Página 3 de 40" e "Página 4 de 40" são reconhecidos como o mesmo padrão repetido, mesmo com números diferentes.

Juntando linha quebrada no meio da frase

Cada linha do PDF muitas vezes termina só porque chegou na borda da página, não porque a frase de fato terminou ali. A regra usada aqui: uma quebra de linha é unida (virando um espaço) sempre que a linha anterior não termina com pontuação de fim de frase (ponto, interrogação, exclamação, dois-pontos, ponto e vírgula, aspas ou parêntese de fechamento). Uma linha terminada em abreviação como "Dr." tecnicamente tem um ponto final, então não é unida — o único efeito colateral esperado dessa exceção é deixar uma quebra que deveria ter sido unida, nunca o oposto.

Hifenização de fim de linha: um problema específico de impressão

Documento formatado para impressão às vezes divide uma palavra longa entre o fim de uma linha e o início da seguinte, marcando com um hífen — "exemp-" numa linha e "lo" na próxima, formando "exemplo". Sem correção, essa palavra ficaria quebrada em dois pedaços no texto extraído. A ferramenta detecta esse padrão especificamente (hífen no fim da linha, seguido de letra minúscula no início da próxima) e junta as duas partes sem espaço, reconstituindo a palavra original.

O relatório mostra o que foi de fato alterado

Cada tipo de limpeza aplicada soma uma contagem própria no relatório — quantas linhas de cabeçalho/rodapé foram removidas, quantos números de página soltos, quantas quebras de linha unidas, quantas hifenizações corrigidas. É uma forma de conferir que a limpeza fez sentido para aquele documento específico: um número muito alto de linhas removidas como "cabeçalho repetido", por exemplo, pode indicar que o documento tem uma estrutura fora do comum, valendo a pena olhar o resultado com mais atenção antes de usar.

Cada tipo de limpeza pode ser ligado ou desligado

Nem todo documento precisa de todos os tipos de limpeza — um PDF sem cabeçalho repetido não perde nada com essa opção ligada (ela simplesmente não encontra nada para remover), mas um documento estruturado de forma atípica pode se beneficiar de desligar uma ou outra opção específica para evitar um resultado inesperado. Cada caixa de marcação nesta ferramenta reprocessa o texto já extraído imediatamente, sem precisar carregar o PDF de novo.

Por que manter a marcação de página é útil às vezes

Por padrão, o texto de todas as páginas é unido num bloco contínuo, sem indicação de onde uma página termina e a próxima começa — o resultado mais prático para colar como texto corrido em outro lugar. Mas há situações em que saber a origem de um trecho importa: ao citar um documento longo, referenciar uma página específica de um relatório, ou conferir se algo saiu de onde deveria. Ativar "manter marcação de página" insere um marcador como "[Página 5]" antes do texto de cada página, sem misturar essa marcação com o conteúdo real — útil como referência, descartável com um clique depois se não for mais necessária.

O que esta ferramenta não faz

Ela não faz reconhecimento óptico de caracteres (OCR) — um PDF que é só uma imagem escaneada, sem texto real por trás, não tem o que extrair. Não preserva formatação visual (negrito, tabela, coluna) nem corrige erro de ortografia ou digitação presente no texto original. E não funciona com PDF protegido por senha, que precisa ter a proteção removida antes, com outra ferramenta deste portal.

Perguntas frequentes

Como a ferramenta identifica um cabeçalho ou rodapé repetido?

Olhando as duas primeiras e as duas últimas linhas de cada página: quando uma delas (ignorando números, para pegar também um rodapé com número de página variável) se repete em pelo menos metade das páginas do documento, é tratada como cabeçalho ou rodapé fixo e removida de todas as páginas onde aparece. Documentos com menos de três páginas não passam por essa detecção, por não haver repetição suficiente para confirmar o padrão.

Por que juntar linha quebrada pode, às vezes, unir frases que deveriam ficar separadas?

Porque a regra usada é uma heurística: uma quebra de linha é unida quando a linha anterior não termina em pontuação de fim de frase. Uma linha terminada em abreviação ("Dr.", "etc.") tem pontuação de fim de frase sem ser o fim de verdade, e por isso não é unida — esse é o único tipo de erro esperado (deixar uma quebra que deveria ter sido unida), nunca o oposto (juntar duas frases que deveriam ficar separadas).

O texto extraído preserva a formatação original do PDF (negrito, tabela, coluna)?

Não. A extração pega só o conteúdo textual, na ordem de leitura que o PDF declara internamente — negrito, itálico, tabela e layout em coluna não são preservados. Um PDF com colunas lado a lado pode ter o texto extraído fora da ordem visual esperada, dependendo de como o arquivo foi gerado originalmente.

A ferramenta funciona com PDF protegido por senha ou PDF escaneado (imagem)?

Não com nenhum dos dois. PDF protegido por senha precisa ter a proteção removida antes (há uma ferramenta própria para isso neste portal). PDF escaneado — uma imagem do texto, sem camada de texto real por trás — não tem texto para extrair; seria necessário reconhecimento óptico de caracteres (OCR), que esta ferramenta não faz.

O que significa manter ou remover a marcação de página?

Quando ativada, cada página do texto extraído vem precedida de uma marca como "[Página 3]", útil para saber de onde veio cada trecho ao consultar o texto depois. Desativada (o padrão), o texto de todas as páginas é unido num bloco contínuo, sem essa marcação — mais prático para colar em outro lugar como texto corrido.

Ferramentas relacionadas

  • Limpar texto colado

    Normaliza marcação de markdown, pontuação curva, caracteres invisíveis, espaçamento e quebras de linha soltas — cada tipo de limpeza é uma opção separada, com relatório de quantas ocorrências de cada uma foram encontradas.

  • Conferir texto antes de enviar

    Inspeciona o texto colado sem alterar nada e reúne num relatório único o que costuma causar problema ao enviar para um formulário ou sistema: caracteres invisíveis e de controle, marcação de markdown residual, espaços múltiplos, quebra de linha irregular, tag HTML solta e trecho sem espaço longo demais.

  • OCR de imagem e PDF escaneado

    Reconhece o texto de uma imagem ou de um PDF escaneado, página por página, em português ou inglês, com progresso e opção de cancelar — o resultado sai como texto simples e também na mesma estrutura usada para gerar .docx ou .xlsx diretamente, sem precisar de um PDF com texto real.

  • Converter imagens em PDF

    Controla a ordem das páginas, o tamanho do papel e a margem — pensado para páginas fotografadas com celular, não para PDFs prontos.