截图取字:图上的字,选中就能复制

截图里的字不能选、不能搜、不能复制,是这类工具最常见的一处别扭。快咔把识别结果按行盖回原来的位置,你像在网页上一样拖选就能复制;不想要图只想要文字的时候,还有一条更直接的路。模型跑在你自己的电脑上,全程零联网、零上传。

最后更新 2026-09-06

两种取字方式,对应两种不同的需求

第一种是先截图、再取字。选区确定后按 Ctrl+T,识别结果会按行盖回原来的位置——每一行文字都落在它在画面里本来的坐标上,你可以像选网页一样拖选,Ctrl+C 复制。再按一次 Ctrl+T 把文字层收起来,回到普通的标注状态。适合「这张图我还要标注、还要保存,顺手把里面某一段抄走」。

第二种是直接要文字,不要图。按 Ctrl+Shift+T 进入转文字模式,框完选区就自动识别,文字直接进剪贴板,整个过程不出图、不落盘。适合「网页上的一段不可复制的文字」「报错弹窗里的一串路径」「别人发来的图片里的一段地址」这类一次性场景。

两条路走的是同一套识别,区别只在于结果去哪儿。多数人用熟之后会固定用后者,因为它少两步。

模型跑在你自己电脑上,一个字节都不上传

识别用的是本地的 PP-OCRv5 mobile 模型:检测 4.5MB、识别 15.8MB,加上一份字典,三个文件随安装包一起发,不需要联网下载。推理跑在 onnxruntime-web 的 wasm 上,所以整条链路里没有原生模块,也没有任何一次对外的网络请求。

这不是一句承诺,是可以自己核对的:客户端、原生插件、连这个官网都在同一个仓库里,你可以看它到底截了什么、存到哪、有没有往外发;不信任别人打的包就自己 clone 编译一份。截图软件能看见你的整个屏幕,这件事唯一诚实的回应方式就是把代码摊开。

一个设计上的取舍值得说明:模型文件缺一不可,缺了「提取文字」按钮整个不出现,而不是让你点下去再报错。宁可少一个按钮,也不给一个按了没反应的按钮。

为什么不用 Windows 自带的 OCR

试过,而且是量过之后排除的,不是凭印象。三条路线的实测结果:

  • Windows 自带的 Windows.Media.Ocr:27 毫秒,快得没话说,但中文不可用——「卸载 快咔」识别成「向 卸 载 快 咔」,「ChatGPT」识别成「令 C ChatG」。直接排除。
  • OvisOCR2-0.9B 一类的大模型:精度好,能出表格和公式,但要额外下载 0.8 到 1.9GB 的运行时和模型;更关键的是它是页面级文档解析器,不给逐行坐标,做不了「盖回原位可选中」这个交互。
  • PP-OCRv5 mobile:冷启动 1.6 秒(含模型加载),热态约 470 毫秒,合成图逐行完全一致 5/5。综合精度、体积和坐标能力,是这三条里唯一同时满足的。

识别层留了 provider 接缝:以后要接页面级文档解析(表格转 HTML、公式转 LaTeX 这类 PP-OCR 给不了的能力),在识别入口分叉即可,工具条、文字层、快捷键都不用动。

识别不理想的时候,先看这几点

  • 字太小:识别的输入就是屏幕上的那些像素。系统缩放低、字号小的时候,先把目标放大再截,比反复重试有效得多。
  • 显示器休眠或处在锁屏、UAC 这类安全桌面时,抓屏拿回来的是全黑画面,识别自然是 0 行。这时候问题不在识别,在抓屏。
  • 艺术字、竖排、严重倾斜的文字超出了 mobile 档模型的舒适区。这是模型体量换来的启动速度和包体积,是明确的取舍。
  • 识别是一次性的:文字层不会被保存进 PNG,也不会跟着钉图窗口走。要留文字就复制走。

取字相关的按键

按键 / 入口作用
Ctrl+Shift+A区域截图,先出图再决定要不要取字
Ctrl+T提取文字:识别结果按行盖回原位,可拖选;再按一次收起
Ctrl+C复制拖选中的文字
Ctrl+Shift+T截图转文字:框完直接识别,文字进剪贴板,不出图
Esc退出当前模式

常见问题

截图取字要不要联网?会不会传到云端?
不联网,也不上传。模型随安装包发布、在你本机推理,没有账号、没有云端、没有埋点统计。
识别一次要多久?
第一次约 1.6 秒(要加载模型),之后热态约 470 毫秒。推理窗口空闲 5 分钟自动销毁,下次再用会重新经历一次冷启动。
识别出来的文字能保留原来的排版吗?
按行保留位置。文字是盖在原来的坐标上的,所以拖选的顺序和你在画面上看到的一致;但它不做表格结构还原和公式转换。
能识别英文和数字吗?
能。PP-OCRv5 是中英混排模型,中文、英文、数字在同一次识别里出结果。

继续看