今日判断
今天的核心不是模型排行榜,而是一条清晰的分界线:模型底座在快速变便宜、变快,而企业侧真正稀缺的资产正在变成业务测试集、权限治理和失败回放。
一家连锁企业的人事知识库完成了 1000 条真实页面的逐题复核——评审不再只看"答案像不像",而是核对页面里的文字、表格、图片和下载按钮;同一天,DeepSeek V4 Pro 正式上线并原生适配 Responses API,Google 发布价格减半的 Gemini 3.7 Flash。FDE 的长期价值不在替客户选一次模型,而在把同一套业务测试集、风险边界和结果指标长期保留下来——模型可以换,测试集不能丢。
重点信号
企业知识库验收升级:1000 条真实页面逐题复核,参数对比进入可回查阶段
- 来源:FDE 企业现场实践
- 某连锁餐饮集团的人事知识库测试进入第二轮:两个独立测试主体使用同一批 500 个问题,共核对 1000 条实际回答,页面读取失败数为 0。评审方式从"关键词匹配"升级为逐题核对文字、列表、表格、图片、下载按钮和文件链接。本轮测试主体 A 平均 9.77 分,B 平均 9.60 分,差异仅 0.16 分。
- 为什么重要:这展示了企业知识库验收的关键跃迁——从"答案像不像"到"页面是否完整、用户能否办成事、失败能否定位"。同题输入、独立主体、逐页证据和版本记录,比单次高分更重要。但也要清醒:平均分是内部评分口径,不能替代错误分类、真实员工采用率、转人工率和节省工时。企业知识库的五层证据链是:同题输入 → 完整页面 → 办事结果 → 失败分类 → 真实采用——前两层证明系统可测,后两层才证明生产价值。
DeepSeek V4 Pro 正式上线:Agent 底座原生适配 Responses API 与 Codex
- 来源:DeepSeek 官方 | 原文链接
- DeepSeek 于 8 月 13 日正式上线 V4 Pro,App、网页端和 API 同步更新;API 原生支持 OpenAI Responses API 格式并针对 Codex 适配,支持 low/high/max 三档思考强度。官方公布 Terminal Bench 2.1 为 87.9、Toolathlon-Verified 为 74.1;峰谷新价格 8 月 17 日生效。
- 为什么重要:标准接口大幅降低了换模成本——企业应把模型名从流程规则中解耦,让底座可替换。但接口兼容不能替代业务回归:换模型前必须用同一任务集比较质量、时延、工具调用成功率、人工接管率和总成本。
Google Gemini 3.7 Flash 发布:价格减半,通用模型溢价持续压缩
- 来源:Google DeepMind | 原文链接
- Google DeepMind 于 8 月 13 日发布 Gemini 3.7 Flash,定位编程与智能体工作模型;价格为每百万输入 token 0.75 美元、输出 3.75 美元,较上一代 Flash 减半。
- 为什么重要:DeepSeek 强化 Agent 接口与峰谷定价、Google 直接降价——同日两条信号说明企业选型的决策单位应从"token 单价"换成"单位合格任务成本":模型价格 → 首次成功率 → 失败重跑 → 工具调用 → 人工复核 → 最终合格任务成本。token 单价只是成本分项,便宜但一次做不对的模型,总成本可能更高。
对 FDE 从业者的启发
- 测试集是比模型更长期的资产:模型每月都在更新降价,但企业的业务测试集、评分模板和失败样本库可以跨模型复用。FDE 交付里最值钱的不是"接了哪个模型",而是这套可回查的验收体系。
- 验收看页面,不只看文本:企业知识库的回答经常包含表格、图片、下载链接——任何一个元素缺失,员工就办不成事。逐页核对应成为标准动作。
- 总平均分之后要追四个数字:Top 错误类型、严重错误数、两测试主体的差异题、真实员工任务成功率。平均分 9.77 不是上线依据,错误分布才是。
- 新模型统一走"同任务替换测试":质量、工具调用成功率、时延、价格、失败重跑和人工复核成本同时记录,用单位合格任务成本做决策。