洞察 · Field Notes
我们每周读论文,
是为了让你少开一场无效会。
不追热点、不堆概念。每一篇只回答一个问题:这对你的下一个 AI 决策意味着什么。文末全部带来源;转引的会写明“经转引”。
重头 · No.01
95% 的试点为什么失败——以及那 5% 做对了什么
MIT 的数字人人会背,但很少有人接着问:那 5% 长什么样。答案不光鲜,甚至有点土——它们赢在最无聊的地方。
斯坦福 Enterprise AI Playbook · MIT NANDA 2025
先摆规模:88% 的组织至少在一个职能用上了 AI(McKinsey),但只有约三分之一推到了企业级规模;MIT NANDA 的口径更狠——95% 的生成式 AI 试点没有产生可衡量的财务影响。问题不在模型不够聪明,在组织没有准备好让聪明落地。
失败集中在六处,前三名都很“软”
- 35%
组织没准备好采用
试点做完没人接。
- 27%
关键知识从未沉淀下来
老师傅的手艺没文档化,AI 学不到真本事。
- 18%
法务与合规拖死项目
合规被当成验收关口,审批一等等到窗口关闭。
- 16%
技术不成熟
演示惊艳,生产失灵。
- 14%
选错场景、预期过高
拿着方案找问题,而非反过来。
- 12%
没人挂帅、人才缺口
牵头人一调岗,项目就地断电。
失败根因占比(多选可重叠)· Enterprise AI Playbook 附录 B
那 5% 的三个反直觉习惯
其一,同一位高管从失败一路挂帅到成功。研究中每个成功案例的挂帅高管,都曾挂帅过失败项目。失败没有吓跑他们,因为没人因失败受罚,复盘替代了追责。
其二,把试点当实验而不是政绩。73% 的成功者有意从小处开始,63% 明确把试点定位成“实验”——实验没有丢脸这回事,只有数据和结论。
其三,用反馈闭环代替上线日期。100% 的成功项目走迭代,瀑布式转型在 51 个样本里是零。上线日是一个日期,反馈环是一种呼吸。
对你的三条含义:检查你的失败项目里有没有人负责复盘;检查你正在立项的试点有没有“实验”的合法身份;检查你的验收文档里写的是日期还是指标。
No.02 · 场景选择
智能体的甜蜜区:现在就该让 AI 自主干活的四类场景
“Agent 能不能上”不是勇气问题,是判据问题。四条全中再放手,中两条用审批,全不中先别动。
同一类任务每天在发生
发票、工单、告警、简历。单次价值可以小,×一万倍就是预算级影响。研究样本里跑得最快的案例全是重复任务。
“干得好”能被机器判定
损耗率、拦截率、准确率、时限。定不出验收指标的场景,AI 做完了你都无法宣布成功——95% 试点正死在这里。
错了有兜底,不会不可逆
补一单、重发一封、人审例外。零容错场景(大额放贷、用药)不是不能做,是必须换审批式监督做。
Agent 伸手够得到事实
59% 的企业数据散在互不打通的系统里。判据四通常是真正的瓶颈——这也是诊断阶段数据地图先于场景清单的原因。
注意金色条:审批式并非落后,现场服务 80% 恰说明“选对档位”比“够大胆”重要。
能力边界:别派 Agent 去它够不着的任务
METR 的口径下,前沿模型能可靠自主完成的任务时长大约每 7 个月翻倍,2026 年初约等于人类专家 15 小时的工作量——听起来乐观,但同一份数据显示:需要人类约 3.5 小时的任务,模型成功率已跌破 50%。能力上限不是平均数问题,是长尾塌方问题。
企业侧的采纳也印证了分层:Anthropic 经济指数显示企业 API 调用 77% 是全自动模式,而个人用户以人机协作为主——企业更敢放手,前提是场景选对了。
METR、Anthropic Economic Index · 经 Enterprise AI Playbook 第 3/8 章转引
落地建议一句话:从“15 分钟级”的重复任务开始放手,“半小时级”的监督着干,“小时级”的先当副驾驶用。能力每 7 个月翻倍,你的路线图该每季度重排一次。
No.03 · 本土判断
中国企业的窗口期,
比大多数人以为的宽
谈 AI 转型绕不开“差距”二字。但把三组事实摆在一起,结论会反过来。
其一:模型侧的代差,比叙事里小
按 token 用量计,OpenRouter 全球前五模型中四个是中国开源模型(Qwen、Kimi、MiniMax、GLM 等),主要驱动力正是智能体工作流;开源新模型发布时通常已达专有模型的九成以上质量,单价却只有约六分之一。对企业意味着:多模型路由不是备胎策略,是成本与自主性的两全之策——而中国市场恰好坐在全球最厚的一层开源供给上。
其二:中型企业的体质,就是为这一轮准备的
“中型公司和小型公司如果获得正确的能力,非常有希望赢得 AI 革命。决策快得多,遗留系统少得多。”
—— 某 PE 合伙人 · Enterprise AI Playbook 第 7 章。这句话的主语,大半个浙江、江苏都能对号入座。其三:本土实践本身就是稀缺证据
斯坦福那 41 家组织里,亚洲只有 5 家。这意味着任何一家认真做落地的中国企业,其踩坑记录在全球样本里都是稀有物种——也是任何一家认真服务中国企业的咨询公司该明白的事:谁先把本土案例做出可核查的数字,谁就在说全球没人说过的话。
“今天占样本 20% 的智能体项目,很可能三年内占多数。实验的窗口正在关闭。”
—— Enterprise AI Playbook 结论章No.04 · 行业信号
中国一线工程界,
已经给出了答案
2026 年 10 月下旬,上海将有一场软件工程大会:20 个专题、92 场演讲,讲者几乎全部来自国内一线技术团队。我们在会前逐条读完了全部官方议程,把值得企业决策者知道的信号写在这里。
基于官方专题简介与演讲标题的研究整理 · 检索 2026-09
先摆一个扎眼的事实:在这份 20 个专题的议程里,没有一个专题在讲“怎么训模型”。模型能力已被默认为水电煤气,全部议程围绕同一件事:怎么把智能体从演示搬进生产,并且跑得稳。讲者机构名单本身就是一份行业名录——阿里、字节、蚂蚁、小红书、腾讯、美团、网易、快手、百度、蔚来、传音等一线团队悉数在场,讲的全是生产环境里的事。这不是一场新品秀,而是中国工程界的一次集体表态:竞争的重心已从模型转向系统。
信号一:范式收敛了——Agent、Context、Loop 三元组
各专题不约而同切在同一个三元组上:Agent(执行体)、Context(认知供给)、Loop(迭代闭环)。业界对“AI 原生应用长什么样”的共识收敛得比想象快。对企业决策者,这意味着选型问题变了:不再是“用哪家模型”,而是“能不能给智能体供上正确的上下文,配不配得上验证它的结果”。
我们从议程里挑出最可操作的一条判据:画边界,而不是画路径。落到任何智能体项目上是两问:AI 自主行动的范围有没有判据?做错了的动作能不能撤回?这两问在立项当天就有清楚答案的,才配谈“放手用”;答不出的,是在赌博不是在做工程。
信号二:瓶颈从“生成”移到了“验证”
多个专题指向同一笔新负债:AI 生成内容的速度远超验证速度,欠下的“验证债”正在成为新瓶颈——业内开始把“验证追上生成”当作工程体系的核心能力,而不是质量部门的附属品。度量口径随之换轨:看“AI 代码占比”“工具采纳率”的越来越多地被换下,换上“任务吞吐量”“一次通过率”“按期交付率”。一句话:生成量不是交付收益,转型汇报的尺子得换。
信号三:生产级数字出现了,而且带着出处
与一两年前的演示视频不同,这届讲者在专题简介里直接给出运行数字:有团队把 MVP 交付从 80 人日压到 25 人日(−63.6%);一组客服场景把一次解决率从 65% 提到 94% 以上、意图匹配 99% 以上;有团队 7 天交付 23 个需求,全程人工干预平均仅 2.22 次;还有运维侧 MTTR 降五成的案例。这些数字出自讲者团队公开撰写的议程简介,是否适配你的业务要逐一验证——但至少说明一件事:智能体的投产回报已经不是信仰问题,是工程问题。
信号四:最清醒的三句反共识
- 其一
瓶颈不是算力,是人
资深工程师的评审带宽是第一约束——先建确定性的验收门禁,再谈放量。这与 No.01 的“组织没准备好”是同一件事的两种说法。
- 其二
智能体不是越多越好
很多任务用单个智能体或传统自动化更简单。议程中引述的研究显示:没有结构化约束的多智能体系统,错误可被放大十倍。先问该不该用,再问用几个。
- 其三
“无人值守”是伪目标
真闭环的定义收敛为三步:可观测、可评估、可进化。人不是被拿掉的,是挪到两端——定标准在头,审异常在尾。
别人的生产级答案,不会自动变成你的答案。这份议程信号的价值在于验证了一个方向:先画边界,再建闭环,换掉度量尺子。而把它落到你的地形上,第一步仍然是一次诚实的诊断。
近期动态 · 一周值得注意的事
信号,不是噪声
Amazon 以“未经授权的 AI 代理持续访问违反使用条件”为由,屏蔽 Meta 的购物 AI 代理 Muse——而同期 Muse 的移动端增速超过了 ChatGPT 早期移动版。
Agent 时代的入口与数据围墙正在成为新的主战场。你的企业数据准备开放给谁的 Agent?这个问题会从安全评审提前到战略会议。
Anthropic 与 Accenture 成立首个嵌入式评估机构,5 年投入至少 10 亿美元;同期 100+ 专家联署呼吁独立的 AI 评估体系。
“第三方评估内嵌”正在从学术倡议变成采购条款。企业侧的对应动作:把评估集建设写进智能体项目预算,而不是验收时才想起。
一支三人安全团队用前沿模型在 72 小时、不到 3,000 美元成本内攻入 OpenAI 员工账户,波及多家平台;仅一家公司检测到异常。
攻击者已经用上 Agent,防守方还在排期。治理与红队演练不是合规装饰,是攻击成本曲线逼出来的必需品。
Claude Code 重新推出 Projects:多智能体线程化协作、共享记忆、编排器指挥工作流,处理方式类似代码合并冲突。
多智能体编排的工程模式在快速收敛。企业软件栈的“Agent 就绪度”会在两年内变成选型硬指标——现在建的多模型网关正是它的地基。
AfterQuery 成为 YC 史上最快独角兽(估值 32 亿美元);YC 2026 夏季批次次被 AI、机器人、能源主导,浮动核动力数据中心已获超 40 亿美元意向订单。
资本在用脚投票:智能的瓶颈正从模型转向能源、数据与物理执行。对应用层创业者和企业甲方反而是好消息——模型红利期,正是采购与自建的高性价比窗口。
春季美军行动前,飞机已升空,最后时刻发现关键情报系 AI 伪造——幻觉第一次以这种代价进入公众视野。
“正确的部署方式加上适当的安全保障”不再是免责声明,是流程设计。人工监督的档位选择(见 No.02)在这种场景里就是生命线。
动态均系媒体公开报道转述(The Verge、TechCrunch 等),检索于 2026 年 9 月;细节以原始报道为准。