可编辑的文档

PDF 转 Word:何时提取文本,何时使用 OCR

选择读取模式、检查原稿,将 PDF 文本转换为可编辑段落,同时注意图片中的文字。

ToolMellow ·

先尝试选中一句话

PDF 可以包含文本、文字图片,或两者兼有。已有文本通常无需光学字符识别即可读取;扫描页一般需要 OCR 来识别图中的文字。选择文本是有用的初步检查,但能选中标题并不证明该页其余部分也有文本层。

按页面内容选择读取模式

ToolMellow 的自动模式读取已有文本层,仅在未找到文本的页面上使用所选 OCR 语言。这适用于原生文本页和扫描页分开的文档。若同一页既有可选标题,又有扫描的发票,请对所有选定页面使用 OCR,才能同时考虑图片中的文字。即使原稿看起来清晰,OCR 也可能出错。

选择印刷文字的语言

读取扫描页前,请选择英语、简体中文、印地语、西班牙语、法语、阿拉伯语、孟加拉语、德语、意大利语或葡萄牙语。一次任务只用一种语言;文档语言变化时,请分开读取不同页段。工具不提供语言检测或翻译。仅在需要 OCR 时下载所选模型;已有 PDF 文本不需要下载 OCR 模型。更改语言会清除先前的审阅内容和下载结果,以免与新结果混淆。

导出前对照原稿

审阅区显示原始页面以及可编辑文本或重建的内容块。请检查姓名、日期、金额、账号、标点、表格单元格和阅读顺序。提取文本可能遗漏表单值或使用意外顺序。OCR 置信度只是引擎的估计,并不保证某个数字正确。创建 Word 文档前,请修正所选版本;纯文本和结构版本分别保留编辑。

选择普通段落或经审阅的结构

读取前启用“重建文档结构”,以检测段落、带标签的标题与简单列表、单栏或双栏区域、带标签或简单对齐的表格、基本样式和支持的图片裁剪。检查标题级别、列表样式、嵌套和编号。自定义标签保留为文本;跨源页面的列表按可见起始编号导出为独立 Word 列表。可以编辑单元格、调整块顺序、跨栏移动内容,并从页面裁剪缺失图片。结果为原生可编辑 Word 内容,保留支持的字体名称与纯色文字,包括段落和单元格内的混合样式。文本编辑不会改变编辑区外的样式。检查字体、颜色和手动下划线控件;字体不嵌入,因此缺失字体会被替代。透明度、图案、无法匹配的绘制文字、精确定位、链接和交互表单不会保留。可选源页面尺寸、Letter 或 A4,文字仍可能重新排版到更多页面。需要原貌时,请保留 PDF。

选择便于处理的页段

PDF 最大为 50 MB;最多选择 50 个源页面,其中 OCR 页面最多 10 个。2-4, 7 这样的范围可减少处理量,也更便于仔细审阅。OCR 面向英语、简体中文、印地语、西班牙语、法语、阿拉伯语、孟加拉语、德语、意大利语或葡萄牙语的印刷文字;结构模式利用识别出的文字位置,因此需要方向端正的扫描页。模糊扫描、手写、复杂布局和列表外语言需要其他流程。超出本地渲染或时间限制时,工具会停止任务。

统计审阅后的文本

“统计审阅文本”会打开字数统计器,内容与“下载审阅文本”一致,并遵循所选源页面顺序。它使用您选定的纯文本或结构版本,包括表格单元格和列表文字的修改。图片不会变成词语。传递仅进行一次,保留在标签页内存中,不把文本放进 URL 或浏览器存储。字数统计器最多接受一百万个字符(包括分页分隔符);更长文本仍可下载。在字数统计器中清除会丢弃传入文本及撤销历史。

关闭前保存结果

PDF、密码、审阅编辑和结果均保留在标签页内存中。识别引擎和所选语言模型按需从 ToolMellow 加载,文档不会上传。刷新或离开前请下载 DOCX,再用文字处理软件打开并重新检查。

动手试试。