今日判断
一个常被误写成"准确率高不高"的工具问题,在真实企业现场变成了生产系统问题:某连锁餐饮企业的票据 OCR 项目,对 344 张图片拆出 22,863 个识别项进行全量评测——19,022 项可以成为机器自动通过候选(83.20%),3,841 项必须保留人工复核(16.80%)。
关键不是宣称 83% 自动化,而是同时建立了三段式验收:主引擎全量处理 → 第二工具交叉复核 → 人工确认高风险冲突。这正是 FDE 的现场价值:先建立同口径基准,再选择主引擎,用第二工具处理风险项,最后把人工接管边界写进流程。
重点信号
企业 OCR 全量评测:22,863 个识别项的三段式生产验收
- 来源:FDE 企业现场实践
- 某连锁餐饮企业的票据识别项目完成全量评测:344 张图片被拆成 22,863 个识别项。主工具(RapidOCR)判定清晰 15,187 项,7,676 项进入第二工具(PaddleOCR)复核;两工具一致 3,835 项,不一致 3,714 项,第二工具无输出 127 项。最终 19,022 项为机器自动通过候选(83.20%),3,841 项保留人工复核(16.80%)。已有人工标准答案样本准确率为 276/291,即 94.85%。
- 为什么重要:企业 AI 不能只报一个"准确率"。这个案例展示了 FDE 应该同时记录的六个指标:处理覆盖率、字段准确率、自动通过率、双工具冲突率、人工复核率、单项复核耗时。83.20% 是筛选通过率,不是全量真实准确率——混淆这两个数字,是企业 AI 项目最常见的验收陷阱。
千问增加思考研究、定时任务和办公助理入口
- 来源:千问 APP 官方 | 原文链接
- 千问于 8 月 7 日更新,新增思考研究、定时任务、办公助理、语音通话等能力,并支持 Qwen3.8-MAX。办公智能体正从一次问答走向持续任务和专门工位。
- 为什么重要:入口的增加降低了使用门槛,但企业部署仍需补上身份管理、数据范围、任务触发规则、失败告警和人工接管机制。产品入口更新不等于企业客户采用结果。
Agent Plugins 1.0.0:统一 Skill、工具与智能体插件的打包标准
- 来源:Google Developers Blog | 原文链接
- Agent Plugins 1.0.0 于 8 月 6 日发布,参与方包括 Google、Amazon、Microsoft 等,目标是用统一插件包描述并分发智能体所需的 Skills、工具及相关资源。
- 为什么重要:这意味着 FDE 的可复制交付物不再只是提示词文件,而是带版本、依赖、权限和测试说明的标准化插件包。项目经验如果不能封装、版本化、回归测试,就无法跨客户复制。这是 FDE 从"个人手艺"升级为"工程交付"的基础设施信号。
对 FDE 从业者的启发
- 企业 OCR 验收必须分列六个指标:覆盖率、字段准确率、自动通过率、双工具冲突率、人工复核率、单项复核耗时。只报一个"准确率"是对客户不负责任。
- 人工复核不是自动化失败:16.80% 的人工复核是高风险流程的显性安全成本。金额、长数字和手写字段不能靠模型自信度自动放行。
- 把项目经验封装成可版本化资产:工具组合、阈值配置、字段风险等级、复核规则和测试样本——这些应该被打包成可跨客户复用的 FDE 插件,而不是散落在聊天记录里。