今日判断
今天最有交付价值的新事实,不是又一个模型发布,而是一个企业人事知识库开始拥有一套可复核的测试基线:21 份资料、1000 条模拟问答、约 99% 的初步准确率,以及工资、二维码、节假日、迟到、旷工等高频场景的页面回归。
这标志着 FDE 的工作正在从"搭知识库"进入"拆测试主体、固定高风险口径、建立评分基线、准备真实用户试点"。但必须清醒:约 99% 仍是 AI 模拟测试口径,不是真实用户结果;"减少 80%-90% 重复提问"是目标,不能提前写成业务成果。
与此同时,微软启动 Frontier Transformation Week,主题从"AI 战略"转向"从潜力到生产"——这与今天的实践信号形成对照:大公司在讨论如何从战略走向生产,而真正的生产验收,是一条一条问题测出来的。
重点信号
企业人事知识库形成 1000 条模拟测试基线,并完成高频场景回归
- 来源:FDE 企业现场实践
- 某连锁餐饮集团的人事知识库进入独立测试阶段:导入 21 份人事制度资料;对 1000 条模拟问答做模板化评分,初步准确率约 99%;工资类问题从 AI 临时计算改为固定图片输出;二维码、工资、节假日、迟到、旷工与考勤澄清完成页面回归。
- 为什么重要:高风险知识库不能只靠提示词调优。这个案例展示了 FDE 应该建立的四层验收包:独立测试主体 → 独立知识库 → 真实页面回归 → 模板化评分。其中三个关键方法值得复制:
- 精确口径优先固定输出:工资这类易出错的计算题,与其让 AI 每次临时算,不如固定为经过人工审核的图片直接返回
- 意图澄清优先于回答:模糊提问先反问确认,避免 AI 自行推断导致错误
- 约 99% 要拆开看:需要进一步分为事实正确、引用正确、图片返回、意图澄清、拒答/升级五类指标,才能定位真正的短板
微软启动 Frontier Transformation Week:从"AI 战略"走向"从潜力到生产"
- 来源:微软官方 | 原文链接
- 微软于 8 月 11-14 日举办 Frontier Transformation Week,主题明确聚焦"从潜力到生产",承诺案例、演示与可部署策略。
- 为什么重要:全球最大的企业软件公司把主题从"AI 能做什么"转向"怎么真正上线",意味着"概念验证到生产"已成为企业 AI 的主流议题。但活动页本身只能证明叙事方向,不能证明落地结果——后续只追可核验的客户案例、实施周期和业务数字。对 FDE 而言,真正的生产验收不是大会上的演讲,而是像上面那样一条一条问题测出来的。
对 FDE 从业者的启发
- 每个高风险知识库都要建"四层验收包":独立测试主体、独立知识库、真实页面回归、模板化评分。缺任何一层,就不算准备好上线。
- 精确口径固定输出,模糊意图先澄清:工资、合同金额、政策条款等高风险内容,宁可用固定图片/表格直接返回,也不要让 AI 每次临时生成。模糊提问先反问,不猜。
- 约 99% 不是上线依据,拆开才是:把整体准确率拆成事实正确、引用正确、格式正确、意图澄清、拒答/升级五个维度,找到真正的短板再决定是否进入真实用户试点。
- 真实用户试点必须记录四个基线:真实提问量、一次解决率、转人工率、重复提问下降比例——没有 before/after 数据,就没有业务结果。