1Q26大模型行业复盘:智能体化与B端突围
招银国际 2026 年 4 月的大模型季度复盘:中美顶尖模型差距收窄至 6 分,中高智能区间推理成本一年下降约 75% 到 87.5%,国内厂商的估值驱动已从「模型能力排名」转向「收入兑现速度」。报告自己总结的规律是:商业化进展与对既有工作流的嵌入深度高度正相关。

一、能力差距:从十几分收窄到六分
按 Artificial Analysis 的智能能力指数(涵盖 GDPval-AA、Terminal-Bench Hard、SciCode、Humanity's Last Exam、GPQA Diamond 等十项评估维度)衡量,中国前沿语言模型的智能水平从 2025 年 3 月的约 20 分区间,升至 2026 年 4 月的约 50 分;美国同期从约 35 分升至接近 60 分。中美顶尖模型的差距由约 10 到 15 分收窄至 6 分——对应的具体模型是 Google 的 Gemini 3.1 Pro Preview 与智谱的 GLM-5.1。
这个收窄的性质值得注意:它不是中国追平了,而是两条曲线都在快速上升,中国的斜率更陡。报告横向对比了 12 家中美前沿厂商的最新版本,几个参数细节能看出各家的不同路线。智谱 GLM-5.1 是 744B 总参数、约 40B 激活的混合专家架构,200K 上下文,报告特别指出它的提升完全来自后训练优化——多任务监督微调、多阶段强化学习、跨阶段蒸馏——底座并未更换。小米 MiMo-V2-Pro 则是 1T 以上总参数、42B 激活,约为前代的三倍,混合注意力机制比例由 5:1 提升至 7:1。月之暗面 Kimi K2.5 为 1T/32B,在约 15T 图文混合 token 上继续预训练。阶跃星辰 Step 3.5 Flash 是 196B 混合专家、每 token 仅激活 11B。
海外这边,Gemini 3.1 Pro 与 GPT-5.4 均支持高达 1M token 上下文,Claude Opus 4.6 首次为 Opus 级模型提供 1M token 上下文(测试版)。xAI Grok 4.20 Beta 为 671B/37B,并同步推出多智能体测试版。
二、推理成本:一年降了近九成
这是全篇对商业化最有解释力的一组数字。在中高智能区间(智能指数 20 到 40),推理成本由 2025 年 3 月的约 0.25 到 1 美元/百万 tokens,降至 2026 年 3 月的约 0.0625 到 0.125 美元/百万 tokens,降幅约 75% 到 87.5%。与此同时,输出速度由约 150 到 200 tokens/秒提升至 300 tokens/秒以上,增幅约 50% 到 100% 以上。
成本降一个数量级、速度翻倍,这两件事叠加起来才解释了为什么 2026 年的应用层能突然跑出规模化收入。报告的推理成本口径是输入与输出 token 价格按 3:1 权重加权后的每百万 tokens 成本,引用时需要注意这个加权方式。
三、模态格局:图像仍由美国主导,视频中国占优
图像生成的第一梯队仍由美国厂商掌握——OpenAI GPT Image 1.5、Google Nano Banana 2 与 Pro、Black Forest Labs 的 FLUX.2 [max];国内以字节跳动的 Seedream 4.0 领先,在性价比上 Seedream 4.0 与 FLUX.2 [max] 最接近最优象限。
视频生成的格局则相反。文生视频榜单上阿里巴巴的 HappyHorse-1.0 位居榜首,与字节即梦 Seedance 2.0、昆仑万维 SkyReels V4、快手可灵 3.0 共同构成第一梯队;美国方面由 xAI 的 Grok-imagine-video、Runway Gen-4.5、Google Veo 3 领先。图生视频榜单上前两名同样是 HappyHorse-1.0 与 Seedance 2.0。这些排名基于 Image Arena 数百万次用户投票计算的 ELO 分值。
四、海外平台:ARR 竞赛白热化
Anthropic 是本季增长最快的一家。2026 年 4 月年化经常性收入超过 300 亿美元——2025 年底约 90 亿,不到四个月上涨超过 200%。毛利率轨迹从 2024 年的 -94%,到 2025 年目标 40%,再到 2028 年目标 77%;预计最早 2027 年现金流转正。2026 年 2 月完成 300 亿美元 G 轮融资,投后估值 3,800 亿美元;按 300 亿 ARR 计约 12.7 倍市销率。
增长引擎是 Claude Code:2025 年 5 月公开发布,仅六个月便在 2025 年 11 月达到 10 亿美元 ARR,2026 年 2 月翻倍至 25 亿美元以上。几个使用侧的数字更能说明渗透程度——截至 2026 年 2 月,全球约 4% 的公开 GitHub 提交由 Claude Code 生成(2026 年 1 月为 2%);Anthropic 内部 70% 到 90% 的代码由它产出;企业用户贡献超过 50% 的收入,年消费超过 10 万美元的客户数同比增长 7 倍。2026 年 1 月推出的 Cowork 定位为"通用计算领域的 Claude Code",首月推出 30 余项产品与功能。
OpenAI 2026 年 2 月 ARR 约 250 亿美元,过去三年收入约 10 倍扩张。ChatGPT 周活用户 9 亿(2026 年 2 月,2025 年 10 月为 8 亿),付费企业用户超过 900 万。Codex 周活突破 300 万,API 每分钟处理超过 150 亿 token。但成本侧同样惊人:2026 年现金消耗约 250 亿美元,2027 年 570 亿美元;2025 年推理成本同比增长 4 倍至 84 亿美元。已签署超过 5,000 亿美元的云计算容量承诺。2026 年 3 月底完成 1,220 亿美元融资,投后估值 8,520 亿美元,对应约 34 倍市销率。
xAI 独立 AI 业务 2025 年年化收入约 5 亿美元,2026 年预计增至 20 亿以上。Grok 全球月活约 6,400 万。2026 年 2 月 SpaceX 以全股票方式收购 xAI,xAI 估值 2,500 亿美元。
五、国内平台:从"能力排名"到"收入兑现"
报告最重要的一句结构性判断在这里:国内模型厂商估值驱动的关键,已经从"模型能力排名"演进为"收入兑现速度与路径可持续性"。
智谱 AI 2026 年 1 月 8 日在港交所挂牌,是全球首家以通用大模型为核心主业的上市公司。2025 年收入 7.243 亿元人民币,同比增长 131.9%;付费开发者突破 24.2 万,平台注册用户突破 400 万,覆盖全球 218 个国家和地区,中国前十大互联网公司中有 9 家深度集成 GLM。但财务结构仍然吃力:综合毛利率由 56.3% 降至 41.0%(云端部署占比由 15.5% 升至 26.3%所致),研发费用 31.80 亿元、约为全年收入的 4 倍,经调整净亏损 31.82 亿元。能力侧的证据是 GLM-5.1 在 SWE-Bench Pro 得 58.4 分,超过 GPT-5.4 的 57.7 分与 Claude Opus 4.6 的 57.3 分。定价侧也在收紧——2 月上调编程套餐价格,中国区涨价 30%,海外版涨价 30% 到 100%;截至 2026 年 3 月 API 调用定价较 2025 年底提升 83%。
MiniMax 2026 年 1 月 9 日港股上市,首日涨近 110%。覆盖全球 200 多个国家和地区,超过 70% 的收入来自海外。2025 年收入同比增长 159%,毛利率由 2024 年的 12.2% 升至 25.4%;其中 AI 原生产品收入占 67.2%,开放平台与企业服务占 32.8%。
月之暗面尚未上市,2026 年 3 月起寻求最多 10 亿美元融资,目标估值约 180 亿美元。Kimi K2.5 发布近 20 天的累计收入已超过 2025 年全年总收入——但报告自己加了一个诚实的限定:付费订阅计划 2025 年 9 月才开启,基数较小。
阶跃星辰 2025 年收入近 5 亿元人民币,2026 年预计约 12 亿元。它走的是另一条路——模型在 OPPO、荣耀等手机品牌装机超过 4,200 万台,日均服务近 2,000 万人次;与吉利合作的车型预计 2026 年全年"上车"超过 100 万辆。
DeepSeek 本季没有发布旗舰模型,而是发布了两篇技术论文:mHC(优化注意力机制、降低推理内存开销)与 Engram(跨会话长期记忆架构)。据报道,团队大量精力投入华为与寒武纪芯片的适配与架构重写。
六、应用层:四条赛道的分化
AI 编程是变现最快的一条。据 a16z 2026 年 4 月测算,仅企业场景(剔除个人)AI 编程赛道年化收入规模约 30 亿美元,大幅领先其他企业 AI 应用场景。Cursor 2026 年 2 月 ARR 突破 20 亿美元,过去三个月内翻倍,从 1 亿到 20 亿仅用 14 个月,企业客户贡献约 60%。GitHub Copilot 付费订阅用户 470 万、同比增长 75%,90% 的财富 100 强已部署——但报告点出一个反差:它在微软总收入中占比尚不足 1%。
企业 AI 智能体增速次之。Salesforce 的 Agentforce 在截至 2026 年 1 月的财季 ARR 达 8 亿美元、同比增长 169%,累计完成 29,000 笔交易,超过 60% 的预订来自现有客户扩展。ServiceNow 的 Now Assist 年度合同价值突破 6 亿美元,续约率 98%,客服类产品续约时增售幅度超过 70%。Google Gemini Enterprise 累计售出超过 800 万个付费席位、覆盖逾 2,800 家企业——但报告同样给了反面判断:相对 Google Workspace 超过 30 亿的用户安装基础,渗透率仍然较低。
AI 创意生成稳步增长。2025 年末 MidJourney、Suno、Adobe Firefly、快手可灵的 ARR 分别为 5 亿、3 亿、2.5 亿、2.4 亿美元。Midjourney 的路径最特别——2022 年 8 月上线仅一个月即实现盈利,完全自筹、零外部风投、零营销支出,员工 100 余人。快手可灵 2025 全年收入 10.4 亿元人民币,2026 年 1 月年化 ARR 突破 3 亿美元,App 付费用户环比增长 350%。风险也很明确:Suno 与环球音乐、索尼音乐的诉讼仍在进行;Midjourney 面临 Google Nano Banana 2 单张图片成本低至约 0.067 美元的价格冲击。
AI 搜索仍在探索变现途径。Perplexity 截至 2026 年 3 月 ARR 约 4.5 亿美元,但2026 年 2 月放弃了 AI 整合广告战略,转向订阅优先。Google 方面,AI Mode 日活用户已超过 7,500 万,截至 2026 年 2 月约 48% 的查询触发 AI 概览、同比提升 18 个百分点;Google 全球广告副总裁确认 AI 概览广告与传统搜索广告的用户点击与互动率处于同一水平。
AI 产品的商业化进展,与它对用户既有工作流的嵌入深度高度正相关。
报告自己总结的这条规律,是全篇最可迁移的一句:编程直接替代开发者每天的核心动作、价值好衡量,所以变现最快;企业智能体嵌入已有的软件流程,增速次之;创意生成满足明确的内容生产需求,稳步增长;AI 搜索尚未找到有效变现途径。
汉兴评述:这份季度地图对中国企业的三点提示
第一,成本降了九成,意味着过去被否掉的场景值得重算一遍。很多企业 2025 年做过 AI 场景的投入产出测算,结论是"不划算"。但推理成本在一年内降到原来的八分之一到四分之一,这些测算的分母已经完全变了。该重算的不是要不要用 AI,而是当初那些因为单位成本被否掉的场景。
第二,"嵌入深度决定变现速度"这条规律,反过来就是选场景的标准。报告用四条赛道的分化证明了:越是替代高频核心动作、价值越好衡量的场景,商业化越快。企业内部选试点场景时可以直接套用这个筛子——这个场景是不是员工每天都要做?做完之后有没有一个客观口径能判断做得对不对?两个都是"是",才值得先做。
第三,注意国内厂商的财务结构,它会影响你的供应商风险。智谱研发费用约为收入的四倍、经调整净亏损扩大 29.1%,MiniMax 毛利率虽然从 12.2% 升到 25.4% 但仍然偏低。这不是唱衰——这是整个行业的阶段特征。但对把核心业务押在某一家模型服务上的企业来说,定价上调(智谱 API 定价半年提升 83%)是一个必须计入长期成本模型的变量,而不是意外。
来源:招银国际环球市场《1Q26 大模型进展复盘:关注 Agent 化及 B 端突围》,2026 年 4 月 15 日
「智能体能力成为演进核心主线」
传导链路
带回你的现场
议题谈完总要落到现场。带一个真实的经营问题来,我们和你的人一起把它拆开看。