今日判断
今天最值得关注的不是又多了多少 Agent,而是三种"能力证明"开始分层:
国家级应用测试用统一场景筛出能做成任务的团队(151 家单位、251 个团队同台竞技);产业现场把 SLA 与按结果付费写进商业关系(新石器:客户不再问"车能不能跑",而是问"任务能不能交给你");厂商生态用连接器、审批模式、培训者网络把小企业采用做成分发体系(Claude 小企业版 43 个工作流 + 750 场社区培训)。
对 FDE 而言:证书只能证明知识覆盖,测试只能证明特定任务表现,真正的交付能力仍要由客户任务、连续运行、异常处理、签收和复购共同证明。
重点信号
国家级 AI 安全应用测试公布结果:统一场景筛人才
- 来源:江苏网信网转载国家互联网应急中心 | 原文链接
- 国家级 AI 赋能网络安全应用测试结果公布:活动设置 8 个真实安全场景,共 151 家单位、251 个团队报名,32 个团队取得"较好成绩",测试由华为提供昇腾软硬件环境。入选团队构成多元——既有人民网、中国人民公安大学这样的机构,也有江苏农商联合银行等企业和福州大学至诚学院等高校。
- 为什么重要:这是"统一任务、统一环境、竞争样本、外部结果"的能力筛选机制——比证书、挂牌或课程结业都更接近真实能力证据。它给 FDE 人才培养提供了一个可复制的中间层:在"会用工具"和"能做企业交付"之间,用统一场景测试建立客观筛选。高校团队与专业机构同台并取得成绩,也说明人才供给的多样性在增加。注意边界:"较好成绩"不是冠军或商业验收,测试表现也不能直接等同企业交付能力——能力证据四级梯是:理论认证 → 统一场景测试 → 真实客户任务 → 连续运行/签收/复购。
新石器:客户从「车能不能跑」到「任务能不能交给你」,SLA 开始进入合同
- 来源:36氪 | 原文链接
- 36氪产业圆桌实录:新石器执行总裁称,规模运营后客户开始围绕时效、成本、稳定性和货损控制讨论 SLA,部分要求会直接写入合同;商业模式从售车延伸到按单、按结果付费。墨奇智能同场补充:酒店客户关心的不是单个动作成功率,而是一个房间能否在时间窗内清洁到标准,以及失败时如何与保洁人员协同。
- 为什么重要:从"功能验收"到"结果责任",是企业 AI 部署成熟度的关键迁移。当客户真实任务越多、责任越明确,企业覆盖的异常和边界越丰富,数据飞轮才转得起来。企业 Agent 合同的正确写法是结果型合同七字段:任务单位 → 服务窗口 → 成功阈值 → 质量/安全边界 → 人工接管 → 失败责任 → 计价与续单条件。先定义客户愿意交付的结果,再决定模型和部署方式——合同结构的变化,比任何技术发布都更能说明行业在走向成熟。
Claude 小企业版:43 个工作流、27 个新集成、750 场社区培训
- 来源:Anthropic 官方 | 原文链接
- Anthropic 9 月 15 日更新小企业版:现包含 43 个工作流和 27 个新集成(Shopify、Salesforce、Stripe、Zoom 等),5 月上线以来安装超过 90 万次。部署机制值得注意:默认每个工作流先处于审批模式,涉及发送、发布或付款时等待用户确认;权限继承原系统权限,可按单个工作流逐步放权。超过 150 家获批培训组织计划举办 750 多场社区工作坊。
- 为什么重要:面向中小企业的落地服务被拆成了"现成工作流 + 连接器 + 权限控制 + 本地培训者"四件套——厂商做前三件,把最后一公里交给本地教练网络。这对培训型服务商是清晰的启示:与其教工具操作,不如做"3 个可复跑的行业工作流包 + 30 天采用陪跑"——每个包写清输入、连接器、审批点、结果指标和人工责任。90 万安装之后厂商还要训练 150 家本地教练,恰恰证明采用的最后一公里无法被产品自身消化。注意:90 万是安装量,不是月活或付费。
对 FDE 从业者的启发
- 用四级梯管理自己和团队的能力宣传:理论认证 → 统一场景测试 → 真实客户任务 → 连续运行/签收/复购。对外表述严格对应证据层级——"进入国家级测试较好成绩名单"可以说,"全国领先团队"不能说。层级混写是信任的慢性毒药。
- 把 PoC 合同改成任务合同:先定义 1 个计价任务、服务窗口、成功阈值、人工接管和失败责任,再谈功能扩张。敢签 SLA 的服务商和只敢列功能清单的服务商,报价可以差一个量级。
- 课程改造成"采用系统":行业工作流包 + 连接器配置 + 审批点设置 + 30 天复跑表——从"教会操作"升级为"陪跑到用起来",这也是培训业务从一次性收入走向持续服务费的路径。