PDF OCR 识别
使用 Tesseract.js 从扫描版 PDF 提取文字,支持多种语言,全部在浏览器本地运行。
100% 本地处理
如何使用 PDF OCR 识别
- 拖入一个扫描版 PDF 文件到上传区
- 选择识别语言(English、中文、日文等)
- 可选输入页码范围,留空表示全部页面
- 点击开始识别,观察进度条
- 复制识别文本或下载为 TXT 文件
功能特点
- 由 Tesseract.js 与 WebAssembly 驱动
- 支持 English、中文、日文、韩文、德文、法文、西班牙文
- 可识别全部页面或自定义页码范围
- 识别过程实时显示进度条
- 一键复制到剪贴板或导出 TXT
- 前 3 页免费识别
- 全部运算在浏览器本地完成,你的数据不会上传到任何服务器。
相关工具