关于 PDF 转文本
从 PDF 中取出纯文本,方便你再次使用——粘贴到文档或邮件、引用报告、放入翻译器或笔记应用,或去掉格式只保留文字。它按文件中存储的原样读取文本,逐页处理,并将结果交给你复制或下载为 .txt。
提取在你的设备上进行,因此即使是机密文档也保持私密。
工作原理
PDF 会在浏览器中用 pdf.js 打开。对于每一页,工具会读取该页的文本层——PDF 存储的真实字符与位置数据——并将其追加,页与页之间用空行分隔。它会随着处理逐步显示文本,因此你能看到它一页页填充,并显示"第 X 页,共 N 页"的状态。不会重新输入或猜测任何内容;它呈现的正是文件中真实存在的文本。
假设与默认值
- 它读取嵌入的文本层,因此结果取决于 PDF 是如何生成的。从 Word、浏览器或大多数软件导出的 PDF 具有干净的文本层;扫描件或纯图像 PDF 则没有。
- 页面按文档顺序显示,用空行分隔。
- 下载为一份纯文本
.txt,以源 PDF 命名。 - 如果找不到可选中的文本,工具会明确告诉你该 PDF 看起来是扫描件,需要 OCR。
局限
- 无 OCR。 它读取现有文本;不识别扫描图像或照片中的文字。如果 PDF 是扫描件,你会得到空结果和需要 OCR 的提示——本工具无法完成那一步。
- 版式无法完全还原。 文本按 PDF 存储的顺序输出,对单栏文档通常正确,但在复杂版式中可能交错或打乱分栏、表格、页眉/页脚和文本框。
- 格式被丢弃——你得到的是纯文本,而非字体、粗体/斜体、标题或表格结构。
- 加密或损坏的 PDF 无法读取,会显示错误。
隐私
文本完全在你的浏览器中用 pdf.js 提取。你的 PDF 及其文本绝不会离开你的设备——不会上传或存储任何内容。

