2026年人工智能指数报告
斯坦福 HAI 第九版《人工智能指数报告》。能力没有停滞但呈锯齿状,中美顶尖模型差距收窄至 2.7%,而三条曲线正在分叉:能力与投资在涨,透明度(指数从 58 降至 40)、公众信任(美国仅 31%)与治理在掉队。专家与公众对 AI 就业影响的看法相差 50 个百分点。

一、能力没有停滞,但它是"锯齿状"的
报告开门见山否定了"AI 能力进入平台期"的说法。2025 年产业界生产了超过 90% 的重要前沿模型;多个模型在博士级科学问题和竞赛数学上达到或超过人类基线;软件工程基准 SWE-bench Verified 上的表现在一年内从 60% 升到接近 100%。
但同一份报告用一个词概括了能力的形状:锯齿状前沿。Gemini Deep Think 在 2025 年国际数学奥林匹克拿到金牌级的 35 分;而在 ClockBench 这个读模拟时钟的任务上,顶级模型的准确率只有约 50%,人类是 90.1%。智能体在 OSWorld 上的任务成功率从约 12% 提升到 66.3%,距离人类水平仅差 6 个百分点——但机器人完成真实家务任务的成功率仍然只有 12%。
这个锯齿的意义对企业很直接:基准分数无法线性外推到你的具体场景。一个能拿数学奥赛金牌的模型,可能在你以为很简单的任务上翻车。
二、中美:差距关上了,但结构完全不同
自 2025 年初起,中美模型在性能排名上多次交替领先;DeepSeek-R1 曾在 2025 年 2 月一度追平顶级美国模型。截至 2026 年 3 月,顶级美国模型仅领先 2.7%。以竞技场 Elo 分计,前列依次是 Anthropic 1,503、xAI 1,495、Google 1,494、OpenAI 1,481、阿里 1,449、DeepSeek 1,424。
但结构差异比排名更值得看。中国在发表量、被引量、专利授权量上领先——全球被引前 100 的论文中,中国占比从 2021 年的 33 篇升至 2024 年的 41 篇;2024 年中国占全球工业机器人安装量的 54%。美国则在顶级模型数量与影响力专利上领先——2025 年美国产出 59 个重要模型,中国 35 个。
一个容易被忽略的分化是开源与闭源的差距在 2025 年重新拉开:2026 年 3 月顶级闭源模型领先顶级开源模型 3.3%,而 2024 年 8 月这一差距仅 0.5%。
三、集中度比能力差距更值得担心
如果只能从这份报告里带走一组数字,报告自己的排序是硬件与数据中心的集中度。美国拥有 5,427 个数据中心,是任何其他国家的 10 倍以上;而台积电这一家代工厂制造了几乎全部领先的 AI 芯片。
算力本身在以每年 3.3 倍的速度增长,已达到 1,710 万 H100 等效单位,其中英伟达占总算力的 60% 以上。参数规模反而进入平台期——已在约 1 万亿附近停留三年,前沿实验室也已停止报告。效率侧则有反例:OLMo 3.1 Think 32B 用比 Grok 4 少 90 倍的参数达到可比结果。
环境成本同步升级:Grok 4 训练排放 72,816 吨二氧化碳当量;AI 数据中心电力容量达 29.6 GW。
四、钱在美国,但人才在流出
2025 年美国私人 AI 投资达 2,859 亿美元,是中国 124 亿美元的 23 倍;私人投资整体增长 127.5%,现占全部 AI 融资的 60%;生成式 AI 增长超过 200%,占全部私人融资的近一半;新获融资的 AI 公司增长 71%,2025 年美国新获融资 AI 公司 1,953 家。中国政府引导基金在 2000 至 2023 年间向 AI 企业投入约 1,840 亿美元。
基建投入的量级同样惊人:Google 报告 2025 年年度资本开支超过 1,500 亿美元。
但有一条曲线是反向的:迁往美国的 AI 研究者与开发者自 2017 年以来下降 89%,其中仅去年一年就下降 80%。一个更长期的对照是公共投入与私人投入的落差——美国 2013 至 2024 年的公共 AI 投资合计 204 亿美元,而 2025 一年的私人投资就是 2,859 亿美元。
五、采用速度超过 PC 与互联网,但美国排第 24
生成式 AI 在三年内达到 53% 的采用率,快于个人电脑或互联网。组织采用率达 88%,其中 70% 在至少一个业务职能中使用生成式 AI。到 2026 年初,对美国消费者的估计价值为每年 1,720 亿美元,相比一年前的 1,120 亿美元增长 54%;每用户中位价值在 2025 至 2026 年间翻了三倍。
但地理分布出人意料:新加坡 61%、阿联酋 64%,而美国排第 24 位,仅 28.3%。
有一个数字应该给所有"智能体元年"的叙事降温:AI 智能体的部署在几乎所有业务职能中仍是个位数百分比。能力已经到了,部署还远远没有。
六、就业信号第一次变成可观测数据
22 至 25 岁软件开发者的就业相比 2024 年下降近 20%。三分之一的雇主预期未来一年裁员,33% 的组织预期 AI 会减少员工数——但接近 50% 预期变化很小或没有变化。预期削减最多的领域是服务运营、供应链、软件工程。
生产率增益的分布是:客服 14% 到 15%,软件开发 26%,营销产出 50%。报告同时给了一个边界条件:过度依赖 AI 可能造成长期的学习惩罚。
生产力提升最强的领域,恰恰是入门级岗位下降最快的领域。
七、负责任 AI 明显掉队
这一章的八条要点措辞最锋利,也最该被完整读一遍。
有记录的 AI 事故从 2024 年的 233 起升至 362 起。几乎所有前沿模型开发者都报告能力基准,但负责任 AI 的报告仍然稀疏。
模型分不清"知识"与"信念"。26 个顶级模型的幻觉率区间从 22% 到 94%。关键的边界条件在于:当虚假陈述被表述为"他人的信念"时模型表现良好,但当被表述为"用户的信念"时表现崩溃——GPT-4o 的准确率从 98.2% 掉到 64.4%,DeepSeek R1 从 90% 以上掉到 14.4%。
透明度在倒退。基础模型透明度指数的平均分从 2024 年的 58 降至 2025 年的 40,主要缺口在训练数据、算力资源和部署后影响的披露。
AI 在英语上表现最好,而且差距比全球基准显示的更大。在斯洛文尼亚语的常识推理测试中,多个模型在方言版本相比标准语版本损失接近 50% 的准确率。
防御在正常条件下有效,在蓄意攻击下减弱。多个前沿模型在标准使用下获得良好的安全评级,但面对越狱尝试时,所有模型的安全表现都下降。
最后一条最难办:安全、公平、隐私这些维度彼此冲突,而权衡关系尚未被充分理解——旨在改善某一个维度的训练技术,始终会降低其他维度。
组织侧倒有进展:AI 专项治理岗位 2025 年增长 17%,没有负责任 AI 政策的企业占比从 24% 降到 11%。主要障碍是知识缺口 59%、预算约束 48%、监管不确定性 41%。
八、专家与公众之间的五十个百分点
这是全报告最刺眼的一组对照。73% 的专家预期 AI 对职场有正面影响,公众只有 23%——相差 50 个百分点。经济影响上是 69% 对 21%,医疗上是 84% 对 44%。
64% 的美国人预期未来 20 年工作岗位减少,只有 5% 预期增加。而专家预测到 2030 年生成式 AI 将辅助 18% 的美国工时,公众估计为 10%。
信任侧同样不乐观:美国对政府监管 AI 的信任度最低,仅 31%,全球平均为 54%,东南亚领先——新加坡 81%、印尼 76%。在 25 个国家中,中位数 53% 信任欧盟能有效监管 AI,37% 信任美国,27% 信任中国。
全球范围内,认为 AI 好处多于坏处的受访者从 2024 年的 55% 升至 2025 年的 59%,但感到紧张的比例也升至 52%——乐观与焦虑在同步上升。印度是 2024 至 2025 年 AI 担忧上升幅度最大的国家,上升 14 个百分点,而兴奋度只升 2 个百分点。
九、教育跟不上,但科学在真正受益
超过 80% 的美国高中和大学生用 AI 做作业,但只有 50% 的初中和高中有 AI 政策,只有 6% 的教师认为这些政策是清晰的。美国四年制大学的计算机科学入学在 2024 至 2025 年下降 11%。一个逆转了十年趋势的信号是:美加新增 AI 博士在 2022 至 2024 年间增长 22%,而全部增量流向了学术界,产业占比持平。
科学侧的进展更实在。2025 年自然科学领域约有 80,150 篇 AI 论文,比 2024 年增长 26%。最佳模型在化学基准 ChemBench 上超过人类专家平均水平;FourCastNet 3 能在 4 分钟内生成 60 天全球预报,比先前方法快 8 到 60 倍,多个 AI 天气模型已进入业务化部署。但边界同样清楚:在天体物理的论文级复现基准上得分低于 20%;在真实生物信息学分析任务上前沿模型约 17% 准确率。医疗侧,2025 年 FDA 批准 258 个 AI 医疗器械,但只有 2.4% 的器械有随机对照试验数据支持。
汉兴评述:这份年报该怎么用
第一,把它当坐标系,不要当结论。这份报告的价值在于给出跨国、跨维度的分布,让你知道自己在哪个位置。比如"组织采用率 88%,但智能体部署仍是个位数"这一组对照,说明绝大多数企业还停在"人用 AI"的阶段,尚未进入"把工作委托给 AI"的阶段。如果你的组织正在纠结是不是落后了,这个分布比任何行业传闻都更值得参考。
第二,负责任 AI 那一章是给采购和法务看的,不是给公关看的。三个数字应该直接进入供应商评估表:幻觉率区间跨越 22% 到 94%(说明模型之间差异巨大,不能通用地假设可靠性);透明度指数从 58 降到 40(说明你越来越难从公开信息判断一个模型的训练来源);以及"安全、公平、隐私相互冲突且权衡未被理解"(说明任何供应商宣称在所有维度都最优,都值得追问)。
第三,那 50 个百分点的认知差距,是内部推行 AI 时真实存在的阻力。73% 的专家乐观、23% 的公众乐观——这个分裂不会因为你在内部发了一份战略文件就消失。它意味着任何一个 AI 落地项目,都同时是一个沟通项目。报告里那条"生产力提升最强的领域恰恰是入门级岗位下降最快的领域"的观察,如果管理层不主动谈,员工也会自己得出结论,只是版本可能更糟。
「生产力提升最强的领域恰恰是入门岗位下降最快的领域」
传导链路
带回你的现场
议题谈完总要落到现场。带一个真实的经营问题来,我们和你的人一起把它拆开看。