拂晓智能 Forshine AI

洞察 · Field Notes

我们每周读论文,
是为了让你少开一场无效会。

不追热点、不堆概念。每一篇只回答一个问题:这对你的下一个 AI 决策意味着什么。文末全部带来源;转引的会写明“经转引”。

重头 · No.01

95% 的试点为什么失败——以及那 5% 做对了什么

MIT 的数字人人会背,但很少有人接着问:那 5% 长什么样。答案不光鲜,甚至有点土——它们赢在最无聊的地方。

斯坦福 Enterprise AI Playbook · MIT NANDA 2025

配合 11 个案例食用 →

先摆规模:88% 的组织至少在一个职能用上了 AI(McKinsey),但只有约三分之一推到了企业级规模;MIT NANDA 的口径更狠——95% 的生成式 AI 试点没有产生可衡量的财务影响。问题不在模型不够聪明,在组织没有准备好让聪明落地。

失败集中在六处,前三名都很“软”

  1. 35%

    组织没准备好采用

    试点做完没人接。

  2. 27%

    关键知识从未沉淀下来

    老师傅的手艺没文档化,AI 学不到真本事。

  3. 18%

    法务与合规拖死项目

    合规被当成验收关口,审批一等等到窗口关闭。

  4. 16%

    技术不成熟

    演示惊艳,生产失灵。

  5. 14%

    选错场景、预期过高

    拿着方案找问题,而非反过来。

  6. 12%

    没人挂帅、人才缺口

    牵头人一调岗,项目就地断电。

失败根因占比(多选可重叠)· Enterprise AI Playbook 附录 B

那 5% 的三个反直觉习惯

其一,同一位高管从失败一路挂帅到成功。研究中每个成功案例的挂帅高管,都曾挂帅过失败项目。失败没有吓跑他们,因为没人因失败受罚,复盘替代了追责。

其二,把试点当实验而不是政绩。73% 的成功者有意从小处开始,63% 明确把试点定位成“实验”——实验没有丢脸这回事,只有数据和结论。

其三,用反馈闭环代替上线日期。100% 的成功项目走迭代,瀑布式转型在 51 个样本里是零。上线日是一个日期,反馈环是一种呼吸。

对你的三条含义:检查你的失败项目里有没有人负责复盘;检查你正在立项的试点有没有“实验”的合法身份;检查你的验收文档里写的是日期还是指标。

No.02 · 场景选择

智能体的甜蜜区:现在就该让 AI 自主干活的四类场景

“Agent 能不能上”不是勇气问题,是判据问题。四条全中再放手,中两条用审批,全不中先别动。

判据 一 · 量大重复

同一类任务每天在发生

发票、工单、告警、简历。单次价值可以小,×一万倍就是预算级影响。研究样本里跑得最快的案例全是重复任务。

判据 二 · 标准清晰

“干得好”能被机器判定

损耗率、拦截率、准确率、时限。定不出验收指标的场景,AI 做完了你都无法宣布成功——95% 试点正死在这里。

判据 三 · 错误可恢复

错了有兜底,不会不可逆

补一单、重发一封、人审例外。零容错场景(大额放贷、用药)不是不能做,是必须换审批式监督做。

判据 四 · 跨系统数据可得

Agent 伸手够得到事实

59% 的企业数据散在互不打通的系统里。判据四通常是真正的瓶颈——这也是诊断阶段数据地图先于场景清单的原因。

IT 运维升级式 90% 现场服务审批式 80% 客户支持升级式 71% 临床文书审批式 66% 软件开发协作式 54% 理赔处理升级式 50% 红=升级式(人审例外)· 金=审批式(逐项批)· 灰=协作式 · 数据:Enterprise AI Playbook 第 3 章职能实测

注意金色条:审批式并非落后,现场服务 80% 恰说明“选对档位”比“够大胆”重要。

能力边界:别派 Agent 去它够不着的任务

METR 的口径下,前沿模型能可靠自主完成的任务时长大约每 7 个月翻倍,2026 年初约等于人类专家 15 小时的工作量——听起来乐观,但同一份数据显示:需要人类约 3.5 小时的任务,模型成功率已跌破 50%。能力上限不是平均数问题,是长尾塌方问题。

企业侧的采纳也印证了分层:Anthropic 经济指数显示企业 API 调用 77% 是全自动模式,而个人用户以人机协作为主——企业更敢放手,前提是场景选对了。

METR、Anthropic Economic Index · 经 Enterprise AI Playbook 第 3/8 章转引

落地建议一句话:从“15 分钟级”的重复任务开始放手,“半小时级”的监督着干,“小时级”的先当副驾驶用。能力每 7 个月翻倍,你的路线图该每季度重排一次。

No.03 · 本土判断

中国企业的窗口期,
比大多数人以为的宽

谈 AI 转型绕不开“差距”二字。但把三组事实摆在一起,结论会反过来。

其一:模型侧的代差,比叙事里小

按 token 用量计,OpenRouter 全球前五模型中四个是中国开源模型(Qwen、Kimi、MiniMax、GLM 等),主要驱动力正是智能体工作流;开源新模型发布时通常已达专有模型的九成以上质量,单价却只有约六分之一。对企业意味着:多模型路由不是备胎策略,是成本与自主性的两全之策——而中国市场恰好坐在全球最厚的一层开源供给上。

token 用量前五 · 金=中国开源模型 · 空=其他 · 检索 2026-09

其二:中型企业的体质,就是为这一轮准备的

“中型公司和小型公司如果获得正确的能力,非常有希望赢得 AI 革命。决策快得多,遗留系统少得多。”

—— 某 PE 合伙人 · Enterprise AI Playbook 第 7 章。这句话的主语,大半个浙江、江苏都能对号入座。

其三:本土实践本身就是稀缺证据

斯坦福那 41 家组织里,亚洲只有 5 家。这意味着任何一家认真做落地的中国企业,其踩坑记录在全球样本里都是稀有物种——也是任何一家认真服务中国企业的咨询公司该明白的事:谁先把本土案例做出可核查的数字,谁就在说全球没人说过的话。

“今天占样本 20% 的智能体项目,很可能三年内占多数。实验的窗口正在关闭。”

—— Enterprise AI Playbook 结论章

No.04 · 行业信号

中国一线工程界,
已经给出了答案

2026 年 10 月下旬,上海将有一场软件工程大会:20 个专题、92 场演讲,讲者几乎全部来自国内一线技术团队。我们在会前逐条读完了全部官方议程,把值得企业决策者知道的信号写在这里。

基于官方专题简介与演讲标题的研究整理 · 检索 2026-09

与 No.01 对照着读:海外样本 × 本土议程 →

先摆一个扎眼的事实:在这份 20 个专题的议程里,没有一个专题在讲“怎么训模型”。模型能力已被默认为水电煤气,全部议程围绕同一件事:怎么把智能体从演示搬进生产,并且跑得稳。讲者机构名单本身就是一份行业名录——阿里、字节、蚂蚁、小红书、腾讯、美团、网易、快手、百度、蔚来、传音等一线团队悉数在场,讲的全是生产环境里的事。这不是一场新品秀,而是中国工程界的一次集体表态:竞争的重心已从模型转向系统。

信号一:范式收敛了——Agent、Context、Loop 三元组

各专题不约而同切在同一个三元组上:Agent(执行体)、Context(认知供给)、Loop(迭代闭环)。业界对“AI 原生应用长什么样”的共识收敛得比想象快。对企业决策者,这意味着选型问题变了:不再是“用哪家模型”,而是“能不能给智能体供上正确的上下文,配不配得上验证它的结果”。

我们从议程里挑出最可操作的一条判据:画边界,而不是画路径。落到任何智能体项目上是两问:AI 自主行动的范围有没有判据?做错了的动作能不能撤回?这两问在立项当天就有清楚答案的,才配谈“放手用”;答不出的,是在赌博不是在做工程。

信号二:瓶颈从“生成”移到了“验证”

多个专题指向同一笔新负债:AI 生成内容的速度远超验证速度,欠下的“验证债”正在成为新瓶颈——业内开始把“验证追上生成”当作工程体系的核心能力,而不是质量部门的附属品。度量口径随之换轨:看“AI 代码占比”“工具采纳率”的越来越多地被换下,换上“任务吞吐量”“一次通过率”“按期交付率”。一句话:生成量不是交付收益,转型汇报的尺子得换。

信号三:生产级数字出现了,而且带着出处

与一两年前的演示视频不同,这届讲者在专题简介里直接给出运行数字:有团队把 MVP 交付从 80 人日压到 25 人日(−63.6%);一组客服场景把一次解决率从 65% 提到 94% 以上、意图匹配 99% 以上;有团队 7 天交付 23 个需求,全程人工干预平均仅 2.22 次;还有运维侧 MTTR 降五成的案例。这些数字出自讲者团队公开撰写的议程简介,是否适配你的业务要逐一验证——但至少说明一件事:智能体的投产回报已经不是信仰问题,是工程问题。

信号四:最清醒的三句反共识

  1. 其一

    瓶颈不是算力,是人

    资深工程师的评审带宽是第一约束——先建确定性的验收门禁,再谈放量。这与 No.01 的“组织没准备好”是同一件事的两种说法。

  2. 其二

    智能体不是越多越好

    很多任务用单个智能体或传统自动化更简单。议程中引述的研究显示:没有结构化约束的多智能体系统,错误可被放大十倍。先问该不该用,再问用几个。

  3. 其三

    “无人值守”是伪目标

    真闭环的定义收敛为三步:可观测、可评估、可进化。人不是被拿掉的,是挪到两端——定标准在头,审异常在尾。

别人的生产级答案,不会自动变成你的答案。这份议程信号的价值在于验证了一个方向:先画边界,再建闭环,换掉度量尺子。而把它落到你的地形上,第一步仍然是一次诚实的诊断。

近期动态 · 一周值得注意的事

信号,不是噪声

Amazon 以“未经授权的 AI 代理持续访问违反使用条件”为由,屏蔽 Meta 的购物 AI 代理 Muse——而同期 Muse 的移动端增速超过了 ChatGPT 早期移动版。

Agent 时代的入口与数据围墙正在成为新的主战场。你的企业数据准备开放给谁的 Agent?这个问题会从安全评审提前到战略会议。

Anthropic 与 Accenture 成立首个嵌入式评估机构,5 年投入至少 10 亿美元;同期 100+ 专家联署呼吁独立的 AI 评估体系。

“第三方评估内嵌”正在从学术倡议变成采购条款。企业侧的对应动作:把评估集建设写进智能体项目预算,而不是验收时才想起。

一支三人安全团队用前沿模型在 72 小时、不到 3,000 美元成本内攻入 OpenAI 员工账户,波及多家平台;仅一家公司检测到异常。

攻击者已经用上 Agent,防守方还在排期。治理与红队演练不是合规装饰,是攻击成本曲线逼出来的必需品。

Claude Code 重新推出 Projects:多智能体线程化协作、共享记忆、编排器指挥工作流,处理方式类似代码合并冲突。

多智能体编排的工程模式在快速收敛。企业软件栈的“Agent 就绪度”会在两年内变成选型硬指标——现在建的多模型网关正是它的地基。

AfterQuery 成为 YC 史上最快独角兽(估值 32 亿美元);YC 2026 夏季批次次被 AI、机器人、能源主导,浮动核动力数据中心已获超 40 亿美元意向订单。

资本在用脚投票:智能的瓶颈正从模型转向能源、数据与物理执行。对应用层创业者和企业甲方反而是好消息——模型红利期,正是采购与自建的高性价比窗口。

春季美军行动前,飞机已升空,最后时刻发现关键情报系 AI 伪造——幻觉第一次以这种代价进入公众视野。

“正确的部署方式加上适当的安全保障”不再是免责声明,是流程设计。人工监督的档位选择(见 No.02)在这种场景里就是生命线。

动态均系媒体公开报道转述(The Verge、TechCrunch 等),检索于 2026 年 9 月;细节以原始报道为准。

延伸资料

《企业 AI 落地手册 · 中文精读》

116 页斯坦福研究的 20 页中文精读:五条落地原则、六根因对照表、11 案例速查卡。预约诊断时可索取(我们手写导语页,说明哪些结论适用于你的行业)。

预约诊断时索取 →

诚实条款 · 研究局限

本站主要依据的 Enterprise AI Playbook 有三个已知局限:样本偏北美(41 家组织中亚洲仅 5 家)、只收录成功样本(幸存者偏差)、调研于 2025~2026 年的美国经济环境。结论的方向可借鉴,系数不可直接套用——这也是我们坚持先诊断、后给数字承诺的原因。完整来源清单 →

读完了,然后呢

判断可以公开写,
结论得对着你的企业说。

这四篇文章回答的是“行业普遍规律”;你的数据在哪、谁该拍板、第一枪打哪,只能对着你的地形回答。两条路都是免费的。