PDF para Word: quando usar extração de texto ou OCR
Escolha um modo de leitura, confira o original e transforme o texto do PDF em parágrafos editáveis sem deixar passar palavras dentro de imagens.
ToolMellow ·
Tente selecionar uma frase
Um PDF pode conter texto, imagens de texto ou os dois. O texto existente muitas vezes pode ser lido sem reconhecimento óptico de caracteres. Uma página digitalizada geralmente precisa de OCR para reconhecer as letras da imagem. Selecionar texto é uma boa primeira verificação, mas um título selecionável não prova que o restante da página tenha uma camada de texto.
Escolha o modo de leitura pelo conteúdo da página
O modo Automático do ToolMellow lê a camada de texto existente e usa o idioma de OCR selecionado apenas nas páginas em que não encontra texto. Isso ajuda em um documento com páginas de texto nativo e páginas digitalizadas separadas. Para uma página que combina um título selecionável com uma fatura digitalizada, escolha OCR para todas as páginas selecionadas, para que as palavras da imagem também sejam consideradas. O OCR pode introduzir erros mesmo quando o original parece nítido.
Escolha o idioma impresso
Selecione inglês, chinês simplificado, hindi, espanhol, francês, árabe, bengali, alemão, italiano ou português antes de ler páginas digitalizadas. Um único idioma vale para a tarefa. Leia intervalos de páginas separados quando o documento muda de idioma; detecção de idioma e tradução não são oferecidas. Somente o modelo selecionado é baixado, quando o OCR é necessário. O texto existente no PDF funciona sem nenhum download de OCR. Mudar o idioma limpa a revisão e o download anteriores para que não sejam confundidos com um novo resultado.
Compare antes de exportar
A revisão mostra a página original e o texto editável ou os blocos reconstruídos. Confira nomes, datas, valores, números de conta, pontuação, células de tabela e ordem de leitura. A extração de texto pode omitir valores de formulários ou usar uma ordem inesperada. A confiança do OCR é uma estimativa do mecanismo, não uma garantia de que um número esteja correto. Corrija a versão escolhida antes de criar o documento do Word; texto simples e estrutura mantêm edições separadas.
Escolha parágrafos simples ou estrutura revisada
Ative Reconstruir a estrutura do documento antes da leitura para detectar parágrafos, títulos com tags e listas simples, regiões de uma ou duas colunas, tabelas com tags ou tabelas simples alinhadas, estilos básicos e recortes de figuras compatíveis. Revise níveis de título, estilos de lista, aninhamento e números. Rótulos personalizados permanecem como texto; listas que se estendem por várias páginas originais preservam os inícios visíveis como listas separadas do Word. Edite células, reordene blocos, mova-os entre colunas e recorte da página as figuras que faltarem. Isso cria conteúdo nativo e editável do Word com nomes de famílias de fontes compatíveis e cores sólidas de texto, incluindo estilos mistos em parágrafos e células. As edições de texto mantêm os estilos fora do trecho alterado. Revise os controles de fonte, cor e sublinhado manual; fontes indisponíveis são substituídas porque as fontes não são incorporadas. Transparência, padrões, texto de desenho sem correspondência, posicionamento exato, links e formulários interativos não são preservados. Estão disponíveis as dimensões da página original, Carta (EUA) e A4; o texto ainda pode se redistribuir por mais páginas. Guarde o PDF quando a aparência exata for importante.
Trabalhe com intervalos de páginas administráveis
Escolha até 50 páginas originais, incluindo no máximo 10 páginas com OCR, de um PDF de até 50 MB. Um intervalo como 2-4, 7 reduz o trabalho e ajuda você a revisar com cuidado. O OCR é destinado a texto impresso em inglês, chinês simplificado, hindi, espanhol, francês, árabe, bengali, alemão, italiano ou português; o modo de estrutura precisa de digitalizações sem rotação porque usa as posições das palavras reconhecidas. Digitalizações borradas, escrita à mão, layouts complexos e idiomas fora dessa lista precisam de outro fluxo de trabalho. A ferramenta interrompe tarefas que excedem seus limites locais de renderização ou de tempo.
Conte o texto revisado
Contar o texto revisado abre o Contador de palavras e caracteres com o mesmo conteúdo de Baixar texto revisado, na ordem das páginas originais que você selecionou. Ele usa a versão escolhida, de texto simples ou de estrutura, incluindo as edições em células de tabela e em texto de listas. Figuras não viram palavras. A transferência é única e fica na memória da aba, sem colocar o texto em uma URL nem no armazenamento do navegador. O Contador de palavras e caracteres aceita até um milhão de caracteres, incluindo os separadores de página; textos maiores continuam disponíveis para download. Limpar no Contador de palavras e caracteres descarta o texto transferido e seu histórico de desfazer.
Guarde o resultado antes de fechar
Seu PDF, a senha, as edições de revisão e o resultado ficam na memória da aba. O mecanismo de reconhecimento e o modelo de idioma selecionado são carregados do ToolMellow quando necessário; o documento não é enviado. Baixe o DOCX antes de atualizar a página ou sair, depois abra-o no seu processador de texto e confira mais uma vez.