PDF a Word: cuándo extraer texto o usar OCR
Elige un modo de lectura, revisa el original y crea párrafos editables sin olvidar las palabras dentro de imágenes.
ToolMellow ·
Prueba a seleccionar una frase
Un PDF puede contener texto, imágenes de texto o ambos. El texto existente suele poder leerse sin reconocimiento óptico de caracteres. Una página escaneada normalmente necesita OCR para reconocer las letras de la imagen. Seleccionar texto es una buena primera comprobación, pero poder seleccionar un título no demuestra que el resto de la página tenga una capa de texto.
Elige el modo según el contenido de la página
El modo Automático de ToolMellow lee la capa de texto existente y usa el idioma de OCR elegido solo en las páginas donde no encuentra texto. Sirve para documentos con páginas de texto nativo y escaneos separados. Si una página combina un título seleccionable con una factura escaneada, elige OCR para todas las páginas seleccionadas, para incluir también las palabras de la imagen. OCR puede cometer errores aunque el original parezca claro.
Elige el idioma impreso
Selecciona inglés, chino simplificado, hindi, español, francés, árabe, bengalí, alemán, italiano o portugués antes de leer escaneos. Se aplica un idioma a toda la tarea. Si el documento cambia de idioma, lee intervalos por separado; no hay detección de idioma ni traducción. Solo se descarga el modelo elegido cuando hace falta OCR. El texto existente funciona sin descargar OCR. Cambiar el idioma borra la revisión y descarga anteriores para no confundirlas con un resultado nuevo.
Compara antes de exportar
La revisión muestra la página original y el texto editable o los bloques reconstruidos. Comprueba nombres, fechas, importes, números de cuenta, puntuación, celdas y orden de lectura. La extracción puede omitir valores de formularios o seguir un orden inesperado. La confianza de OCR es una estimación del motor, no una garantía de que un número sea correcto. Corrige la versión elegida antes de crear el Word; texto plano y estructura conservan ediciones separadas.
Elige párrafos simples o estructura revisada
Activa Reconstruir estructura del documento antes de leer para detectar párrafos, títulos etiquetados y listas simples, zonas de una o dos columnas, tablas etiquetadas o alineadas de forma sencilla, estilos básicos y recortes de figuras compatibles. Revisa niveles de títulos, estilos de lista, anidación y números. Las etiquetas personalizadas quedan como texto; las listas que cruzan páginas originales conservan sus inicios visibles como listas de Word separadas. Edita celdas, reordena bloques, muévelos entre columnas y recorta las figuras que falten. Se crea contenido nativo editable de Word con nombres de familias tipográficas y colores sólidos compatibles, incluidos estilos mixtos en párrafos y celdas. Editar texto mantiene los estilos fuera del fragmento cambiado. Revisa los controles de fuente, color y subrayado manual; las fuentes ausentes se sustituyen porque no se incrustan. No se conservan transparencia, patrones, texto dibujado sin correspondencia fiable, posición exacta, enlaces ni formularios interactivos. Puedes usar dimensiones originales, Letter o A4; el texto puede redistribuirse en más páginas. Guarda el PDF si importa su apariencia exacta.
Trabaja con intervalos manejables
Elige hasta 50 páginas originales, con un máximo de 10 páginas de OCR, de un PDF de hasta 50 MB. Un intervalo como 2-4, 7 reduce el trabajo y facilita la revisión. OCR está pensado para inglés, chino simplificado, hindi, español, francés, árabe, bengalí, alemán, italiano o portugués impresos; el modo estructura necesita escaneos orientados correctamente porque usa posiciones de palabras reconocidas. Escaneos borrosos, escritura a mano, diseños complejos y otros idiomas necesitan otro flujo. La herramienta detiene tareas que superan sus límites locales de renderizado o tiempo.
Cuenta el texto revisado
Contar texto revisado abre el contador de palabras con el mismo contenido que Descargar texto revisado, en el orden de páginas elegido. Usa la versión seleccionada, de texto plano o estructura, incluidas las ediciones de celdas y listas. Las figuras no se convierten en palabras. El traspaso es de un solo uso y permanece en memoria de la pestaña, sin poner el texto en la URL ni en el almacenamiento del navegador. El contador admite un millón de caracteres, incluidos separadores de páginas; el texto mayor sigue disponible para descargar. Borrar en el contador descarta el texto recibido y su historial de deshacer.
Guarda el resultado antes de cerrar
El PDF, la contraseña, las ediciones y el resultado quedan en memoria de la pestaña. El motor y el modelo de idioma elegido se cargan desde ToolMellow cuando hacen falta; el documento no se sube. Descarga el DOCX antes de actualizar o salir, ábrelo en tu procesador de textos y revísalo otra vez.