今日判断
今天最值得抓住的不是"模型又变强了",而是企业 AI 开始分化为两条线:高不确定性任务交给 Agent 并用证据、权限和人工审查约束;确定性任务回归规则脚本,直接嵌入原工作表。
一家连锁企业每月要逐人核对 150-160 多人的考勤,先前用 AI 输出异常清单后还需切回原表核实,实际被一线放弃。新方案改用 Python 确定性规则,在原表逐日标注正常/异常——不是 AI 做不到,而是确定性判定用确定性工具更可靠、更可审计、更容易被一线接受。
与此同时,Anthropic 披露 Claude 已连续数月作为内部 CI/CD 故障的一线响应者——这是真正适合 Agent 的场景:多源数据、不确定根因、需要推理和调查。FDE 的价值,正是先判断"该不该用 AI",再把对的工具接进真实现场。
重点信号
150 人考勤从"AI 分析"改为原表规则标注:确定性任务用确定性工具
- 来源:FDE 企业现场实践
- 某连锁餐饮集团每月逐人核对 150-160 多人考勤。先前方案让 AI 助手输出异常清单,但一线员工需要切回原表逐条核实——多了一步反而更慢,实际被放弃。新方案改用 Python 确定性规则,直接在原表逐日标注正常/异常,只让人工复核异常人员。
- 为什么重要:这是企业 AI 落地中最容易犯的错误——不是所有问题都该用大模型。考勤判定规则清晰、无歧义、可穷举,天然适合脚本处理。用 AI 反而引入了不必要的不确定性和额外的核实步骤。更关键的是结果放回原表,减少了一线员工的上下文切换——比"另生成一张 AI 报告"更可用。FDE 应该在项目立项前增加"AI 不做门":任务量级不足、规则可穷举、平台风控高于收益,就该暂停 Agent 开发,改用确定性工具。
- 注意边界:节省 30%(约 1-2 小时)是开发前的预估目标,不是已实现结果。验收需保留同一份原表,同时记录全量人工基线、脚本用时、异常数、漏放率和最终复核工时。
智谱发布 GLM-5.3:底座持续进化,但企业验收仍不能只看排名与 Token 价
- 来源:智谱官方 | 原文链接
- 智谱于 8 月 19 日宣布 GLM-5.3 API 上线,定价与 GLM-5.2 持平;模型权重计划下周五开源。官方称其在 AA 综合智能指数为 60 分,并宣称单任务成本在旗舰模型中最低。
- 为什么重要:国产旗舰模型持续迭代降价,企业选型的底座候选越来越多——但这恰恰说明,真正的采购依据不应是厂商排名或 token 单价,而是"单位合格任务成本":首次成功率 × 重跑次数 × 工具调用成功率 × 人工复核率 → 最终合格一条任务花了多少钱。排名和 token 价格只是其中一个分项。
Anthropic 披露 CI/CD 一线响应 Agent:首份证据分析中位数 14 分钟
- 来源:Anthropic 官方 | 原文链接
- Anthropic 于 8 月 18 日披露 Claude Tag 已连续数月作为内部 CI/CD 故障的一线响应者。近期每次有情况报告的事故都由它先起草,首份有证据分析的中位数为 14 分钟,最快 4 分钟在首报指出根因。
- 实施结构:独立服务账号,连接 Grafana、日志、PagerDuty、GitHub、Kubernetes 和 Slack;站立指令以 Git 管理的 Markdown Skills 维护,事故教训回写到 lessons.md。修复 PR 仍由人工审查、合并和部署。
- 为什么重要:这是"专用服务账号 + 多源连接 + 版本化 Skill + 事故记忆 + 人工放行"的可复制生产结构,比单次聊天或自动生成代码更接近真实企业 Agent。它恰好印证了今天的主线——CI/CD 故障排查是典型的高不确定性任务:多源数据、不确定根因、需要推理调查,正好适合 Agent。而考勤规则判定是典型的确定性任务,应该用脚本。FDE 的价值是在两者之间画出正确的线。
- 注意边界:数字为 Anthropic 内部团队口径,未公开事故总样本数、对照组 MTTR、误报率或单事故成本;修复权限仍由人工控制。
对 FDE 从业者的启发
- 项目立项前增加"AI 不做门":先检查四个条件——任务量级是否足够、规则是否可穷举、平台风控是否高于收益、嵌入成本是否划算。"不做"也是 FDE 的交付结论,避免为了体现 AI 而制造额外步骤。
- 确定性结果放回原表:一线员工的工具迁移成本远高于想象。与其让他们学一个新系统,不如把结果直接写回他们已经在用的 Excel——减少上下文切换,采用率才可能上来。
- 高不确定性任务学"一线响应 Agent 六件套":专用服务账号 → 多源连接 → 版本化 Skill → 证据情况报告 → 事故教训库 → 人工审批/交接。分列首报时间、根因命中率、人工接管率和单事故成本。