——跨类别对比、支撑技术与趋势展望(第9–16章)
报告日期:2026年9月21日 调研窗口:2024年9月—2026年9月
本篇为报告下半部分,承接上篇(调研方法、分类学总览及通用大语言模型、推理模型、向量嵌入、多模态、图像生成、视频生成六个类别的深度分析),涵盖语音、世界模型与JEPA、端侧小模型、代码/Agent四个类别,以及架构与算力技术栈、跨类别横向对比、趋势洞察与结论。
9. 语音模型
本章调研窗口为 2024-09 至 2026-09,覆盖自动语音识别(ASR,Automatic Speech Recognition)、文本转语音(TTS,Text-to-Speech)与端到端语音对话三条产品线。数据主要来自维度 07 专项调研(24 次中英文独立检索),延迟类指标多为厂商自报与第三方复测并存,已按交叉验证结论标注口径差异。
9.1 品类格局与流行度
9.1.1 Whisper 开源 ASR 基石;ElevenLabs 商业化标杆;Realtime API 2025-08 GA
语音模型在窗口期内呈现”开源基石—商业标杆—实时接口”三层格局。开源 ASR(自动语音识别)一侧,OpenAI Whisper 仍是事实标准:旗舰版本 large-v3 为 1.55B 参数、支持约 99 种语言、MIT 许可,LibriSpeech test-clean 词错误率(WER)约 2.7%,真实世界英语音频 WER 约 8–12%。围绕它形成了完整衍生生态——whisper.cpp(GitHub 4.6 万+ stars)、faster-whisper(基于 CTranslate2,推理提速约 4 倍)、WhisperX(词级时间戳与说话人分离)、distil-whisper(6 倍加速、WER 差距 1% 以内),使 ASR 成为少数”端侧可部署、成本结构独立”而未被统一多模态模型吞噬的品类。OpenAI 自身则于 2025-03 转向 API-only 的 gpt-4o-transcribe 系列($0.003–0.006/min,WER 低至约 2.46%)。
商业化标杆是 ElevenLabs:融资从 2024-01 的 B 轮($80M,估值 $1.1B)升至 2026-02 的 D 轮($500M,估值 $11B,Sequoia 领投),2026 年 ARR 达 $5 亿(2025 年为 $3.3 亿),41% 以上财富 500 强企业采用其平台;该组数字经 SiliconANGLE 与 Bleap 两源交叉一致,置信度高。其实时交互入口一侧,OpenAI Realtime API 于 2025-08-28 正式 GA(gpt-realtime-2025-08-28),随后推出 gpt-realtime-mini(2025-10)与 gpt-realtime-2(2026-05),标志端到端语音对话从演示能力转为生产级基础设施。
9.2 速度与训练难度
9.2.1 端到端 S2S 232–320ms vs 级联 1–2s;Seeduplex 全双工;训练数据跃至 1300 万+小时
速度竞争的核心战场在端到端语音到语音(S2S,Speech-to-Speech)对话延迟。GPT-4o 语音模式端到端音频响应最低 232ms、平均 320ms,而前代级联方案(ASR→LLM→TTS)平均需 2.8–5.4s;当前生产级级联管线仍在 1–2s 量级,端到端 S2S 已进入 200–500ms 区间,逼近人类对话轮转约 200ms 的平均间隙。横向对比(2026-07)显示:字节豆包 Seeduplex 以 210–320ms 居首,其后依次为海螺 Speech 2.6(<250ms)、GPT-4o(约 320ms)、Qwen2.5-Omni(约 350ms)。Seeduplex 为 2026-04 发布的原生全双工模型,词级打断准确率 97.3%,已全量上线豆包 App 并开源 7B 研究版(Apache-2.0);该延迟数据为官方加中文媒体三源交叉,但来源链单一语种,置信度按中档处理。
训练难度方面,数据规模出现数量级跃迁:ASR 标杆 Whisper 使用 68 万小时弱监督音频训练(分布外相对错误率降低 55.2%);TTS 与语音对话的训练数据则从 VALL-E 的 6 万小时(较传统 TTS 大约 100 倍)跃至 Sesame CSM 的 100 万小时、Higgs Audio v2 的 1000 万+小时,直至 Kimi-Audio 的 1300 万+小时。弱监督造标签(ASR 伪标签、双 ASR 交叉验证)已成为标准做法;情感与韵律建模(情感与说话风格纠缠、缺乏强度标注)仍是公认难题,豆包将情感识别 F1 做到 0.81 即被作为核心卖点。
9.3 技术栈与 Top3
9.3.1 codec token 化(SNAC/Mimi/FSQ)范式与 Top3 代表
技术栈的范式核心是神经音频 codec token 化:EnCodec/SoundStream/DAC 将 24kHz 波形压缩为约 75Hz×8 码本的离散 token,使 TTS 转化为”codec 上的条件语言建模”,Transformer、KV-cache、上下文学习等 NLP 技术栈得以整体迁移。代表性 tokenizer 包括 SNAC(2024-10,多尺度 RVQ,12/23/47Hz 三层 token、984bps、仅 19.8M 参数,为 Orpheus 等开源语音 LLM 标配)、Mimi(Moshi 所用,12.5Hz、1.1kbps 流式 codec,首码本自 WavLM 蒸馏语义信息,支撑 80ms 帧级全双工),以及 CosyVoice 2 采用的 FSQ 码本(配合 chunk-aware 因果流式匹配实现 150ms 首包延迟)。架构路线上,AR codec 语言建模(VALL-E 系)、Flow Matching 非自回归(F5-TTS 系)、AR+Flow 混合(CosyVoice 2、MiniMax-Speech)与端到端全模态(GPT-4o Realtime、Qwen-Omni、Moshi、Seeduplex)四条路线并存,Thinker-Talker(文本思考器+双轨自回归发声器)成为主流折中设计。
表 9-1 语音模型 Top3 代表(2024-09 至 2026-09)
模型/厂商 | 品类定位 | 关键指标 | 里程碑 |
GPT-4o Realtime / gpt-realtime(OpenAI) | 端到端 S2S 对话标杆 | 音频响应最低 232ms、平均 320ms | 2025-08-28 Realtime API GA;2026-05 gpt-realtime-2 |
ElevenLabs(Eleven v3 + Scribe) | 语音 AI 商业化标杆 | v3 支持 70+ 语言与情感标签;Scribe v2 独立评测 WER 2.2%;2026 ARR $5 亿、估值 $11B | 2025-06 Eleven v3 公测;2026-02 D 轮 $500M |
豆包实时语音 / Seeduplex(字节跳动) | 中文端到端全双工标杆 | 端到端 210–320ms、词级打断准确率 97.3%;情感识别 F1 0.81 | 2025-01 上线;2026-04 Seeduplex 发布并开源 7B 研究版 |
表 9-1 的三家代表分别占据三条价值轴线:GPT-4o Realtime 定义了端到端延迟的全球参照系(232ms 下限被后续所有竞品作为对标基准),并通过 API GA 化把语音对话变成可调用的基础设施;ElevenLabs 证明专用语音模型的单位经济学可以独立成立——其 $5 亿 ARR 与 41% 财富 500 强渗透率,是”专用品类抵抗统一多模态吞噬”的标志性案例;豆包 Seeduplex 则以 210–320ms 全双工延迟和 97.3% 打断准确率在交互自然度上反超,且通过开源 7B 研究版把全双工能力扩散至社区。三者共同显示,语音品类的竞争焦点已从识别准确率(WER 普遍进入个位数后边际收益递减)转向实时性、情感表现力与商业闭环。
10. 世界模型与JEPA
世界模型(World Model)指学习环境状态演化规律、从而支持”想象”与规划的一类模型;联合嵌入预测架构(Joint-Embedding Predictive Architecture,JEPA)是其中非生成式路线的代表。JEPA 由图灵奖得主 Yann LeCun 于 2022 年 6 月在立场论文《A Path Towards Autonomous Machine Intelligence》中提出,其结构由上下文编码器、目标编码器与预测器三部分组成:预测目标是被掩码信号在潜空间(latent space)中的表示,而非原始像素或 token。这一设计与生成式路线存在根本分野——生成式世界模型(Sora、Genie、Cosmos 等)必须重建每一个像素,算力大量消耗在树叶摆动、光照噪声等对规划无关的细节上;JEPA 则论证智能体只需预测抽象表示即可理解、推理与规划,代价是本身无法生成可视化内容,两条路线在功能上互补而非完全替代。2024-09 至 2026-09 窗口内,该方向从学术立场演变为产业级赌注,本章依次讨论路线之争、技术特征与效率证据,并给出 Top3 代表判定。
10.1 路线之争
10.1.1 潜空间预测(JEPA)vs像素生成(Cosmos/Genie);LeCun”LLM死路”论与AMI Labs $10.3亿融资;IntPhys 2全模型≈随机的诚实校准
窗口期内世界模型领域分裂为两大阵营:以 JEPA 为核心的潜空间预测派(非生成式),与以 Genie、Cosmos、Marble 为代表的像素生成派。LeCun 是最激进的旗手,他公开主张大语言模型(LLM)是通往人类级智能的”死路”,劝研究者”绝对不要研究 LLM”,认为自回归 next-token 预测无法获得物理世界的因果理解与规划能力。2025 年底 LeCun 离开 Meta(背景是 Meta 资源向 LLM 集中、FAIR 探索空间收缩乃至机器人 AI 团队解散),在巴黎创办 AMI Labs(Advanced Machine Intelligence),2026-03 完成 10.3 亿美元种子轮、投前估值 35 亿美元,为欧洲 AI 史上最大种子轮,投资方含贝索斯探险基金、英伟达、三星、丰田创投等;生成式阵营一侧,李飞飞的 World Labs 亦于 2026-02 融资 10 亿美元(估值约 50 亿美元)——“世界模型 vs LLM”已成为十亿美元量级的产业对赌。LeCun 进一步预测”3–5 年内世界模型将取代 LLM 成为主流 AI 范式”,但此为单一来源的预测性观点,应作立场而非趋势引用。
对这场争论最诚实的校准来自基准测试。Garrido 等(2025-02)的三方对比显示:在直觉物理”违反预期”测试中,潜空间预测(V-JEPA 式)成功,像素预测与多模态 LLM 接近随机,简单场景上的排序稳定为”潜预测 > 像素”;但在更难的 IntPhys 2 场景上,包括 JEPA 在内的所有模型全部跌至随机水平,而人类正确率达 85–95%——“没人能宣布胜利”。Meta 自己发布的 IntPhys 2、MVPBench、CausalVQA 三个基准同样确认这一结论,说明”看懂物理”远比”学会规划抓取”困难,是整个路线的共同瓶颈。
10.2 技术特征与效率
10.2.1 I-JEPA→V-JEPA→V-JEPA 2(1.2B、100万+小时视频)→2.1演进;LeJEPA/SIGReg解决表示坍塌
JEPA 家族的落地脉络清晰可循。I-JEPA(2023)是首个视觉 JEPA,以 ViT-H(632M 参数)在 ImageNet-1K 上达约 79% top-1,仅需约 1,200 GPU 小时,而掩码自编码器(MAE)达到 77% 需约 10,000 GPU 小时,效率优势约一个数量级,结构性原因是无解码器、预测在潜空间进行、且只需单视图掩码。V-JEPA(2024-02)将其扩展至视频(时空管块掩码),较生成式视频方法获 1.5–6 倍训练效率提升。V-JEPA 2(2025-06)是首个互联网级视频自监督世界模型:本体 1.2B 参数(ViT-g 编码器超 10 亿;需澄清的是”8B”仅指与 LLM 对齐后做视频问答的系统规模),预训练使用超 100 万小时无标注互联网视频加约 100 万图像。V-JEPA 2.1(2026-03)引入稠密预测损失、深层自监督与多模态 tokenizer 等四项架构创新,真实机器人抓取成功率较 V-JEPA 2-AC 提升 20 个百分点,并补齐深度估计、导航、跟踪等稠密特征能力。
潜空间预测的核心技术难题是表示坍塌(representation collapse):编码器把所有输入映射为常数即可令预测误差归零。I-JEPA/V-JEPA 依赖 EMA 教师网络、stop-gradient 与掩码设计等启发式手段防坍塌,缺乏理论保证。2025-11 的 LeJEPA(Balestriero & LeCun)首次给出完整理论:证明各向同性高斯分布是 JEPA 嵌入的最优分布,并提出基于草图化高斯正则的 SIGReg 直接约束嵌入分布,从而无需 stop-gradient、教师-学生结构与超参调度器——仅 1 个权衡超参数、线性复杂度、约 50 行代码,跨 10+ 数据集与 60+ 架构稳定,ViT-H/14 在 ImageNet-1K 线性评估达 79%。其后续工作进一步证明在潜变量高斯假设下可恢复与真实世界变量线性对应的表征,但该高斯假设也被批评为”最显而易见的软肋”——真实世界潜动态往往非高斯。
10.2.2 效率优势:规划16秒/动作 vs Cosmos 4分钟(论文口径15×,Meta营销30×冲突注记);62小时机器人数据零样本抓取65–80%
JEPA 路线的效率叙事有两根支柱。其一是规划速度:V-JEPA 2 论文第 4.2 节报告,在单张 RTX 4090 上以交叉熵方法(CEM)做模型预测控制,NVIDIA Cosmos(潜扩散动作条件视频生成模型)每计算一个动作需 4 分钟,完整抓取放置轨迹需超 1 小时;而 V-JEPA 2-AC 在每步采样数多 10 倍的条件下仅需 16 秒,且成功率全面更高——因为 rollout 完全在嵌入空间进行,不生成任何像素。可核验数字 16 秒对 240 秒约合 15 倍,Meta 对外宣传的”快 30 倍”为营销口径,Meta 自认双方评估基准可能不同,本章依交叉验证裁定采信论文 15× 口径并在此注记冲突。其二是数据需求的不对称性:V-JEPA 2 的动作条件化后训练仅需不足 62 小时无标注 DROID 机器人遥操作视频,即可得到零样本规划能力,在两个陌生实验室的 Franka 机械臂上实现 65–80% 的抓取与放置成功率。但需指出,省下的只是机器人数据——超过 100 万小时的视频自监督预训练本身仍属大厂级算力门槛。
10.3 Top3代表
10.3.1 Top3表+分析:V-JEPA 2/2.1、Genie 3(720p/24fps实时交互)、NVIDIA Cosmos;候补World Labs
表 10-1 2024-09 至 2026-09 窗口内世界模型 Top3
排名 | 模型(厂商) | 路线与规模 | 关键证据 | 开放性 |
1 | V-JEPA 2 / 2.1(Meta) | 潜空间预测,1.2B(2.1 系列 80M–2B) | >100 万小时视频预训练;<62h 机器人数据零样本抓取 65–80%;规划 16s/动作(论文口径约为 Cosmos 的 15×) | 开源(MIT 许可证) |
2 | Genie 3(Google DeepMind) | 像素生成,约 11B(单一第三方估算,未获官方确认) | 首个实时交互通用世界模型,720p/24fps、分钟级一致性、约 1 分钟视觉记忆;2026-01 以 Project Genie 面向消费者开放 | 闭源(订阅制) |
3 | Cosmos(NVIDIA) | 像素生成(自回归+扩散),4B–14B | 2,000 万小时视频训练;Predict/Transfer/Reason 三线并进;1X、Figure、Uber、XPENG 等采用 | 开放权重(NVIDIA Open Model License) |
表 10-1 反映的并非单一赛道的名次,而是两条技术路线的代表性对齐。V-JEPA 2/2.1 居首,因其是 JEPA 路线最完整的公开实证:以 1.2B 的”小”体量在理解(SSv2 77.3 top-1)、预测(EK-100 动作预期 39.7 R@5)、规划(零样本机器人控制)三位一体上同时给出可复现数据,且以 MIT 许可证开源,构成表征派对抗大参数生成模型的效率叙事核心。Genie 3 代表生成式路线的能力上限——从文本提示实时生成可探索的 720p/24fps 交互世界,已被用于训练 SIMA 智能体,DeepMind CEO Hassabis 称”构建世界模型一直是 DeepMind 通往 AGI 的计划”。Cosmos 则走平台化路线,其价值不在与 V-JEPA 2 比拼规划速度(论文基线中速度落后约 15 倍),而在作为机器人与自动驾驶的合成数据与仿真底座,与 Omniverse/Isaac/GR00T 栈深度绑定。候补者 World Labs(Marble/Atlas)以高斯泼溅生成真 3D 世界,定位介于像素生成与 3D 重建之间,融资与产品节奏强劲(2026-02 融资 10 亿美元、2026-09 发布 Atlas),但其”空间智能”路线尚未在规划类基准上与 JEPA 正面交锋。综合 Insight 7 的判断,路线之争的实际答案是分工而非胜负:理解与规划走潜空间预测,内容生成与合成数据走像素生成,机器人系统两者都需要;而 IntPhys 2 上”所有模型≈随机”的结果提醒,两类模型距”真正理解世界”均有实质距离。
11. 端侧小模型(SLM)
11.1 流行度与市场
11.1.1 从研究话题到产业标配
小语言模型(Small Language Model, SLM,通常指 0.5B–30B 参数区间)在调研窗口内完成了从边缘话题到产业主流的转变。市场侧,MarketsandMarkets 估计全球 SLM 市场规模将从 2025 年的约 9.3 亿美元增长至 2032 年的 54.5 亿美元,复合年增长率(Compound Annual Growth Rate, CAGR)约 28.7%;需注明口径差异——TBRC 与 GMI 的估计分别高出近一个数量级,本章按交叉验证结论(C-11)以 MarketsandMarkets 窄口径为主引用。采用度侧,阿里官方披露 Qwen 家族全球累计下载量超 30 亿次、衍生模型超 30 万个;Google DeepMind 于 2026-08-20 宣布 Gemma 家族累计下载突破 10 亿次;本地推理工具 Ollama 月下载量超 5200 万次,Hugging Face 上 GGUF 格式模型库已增至约 17 万个。终端渗透方面,中国乘用车前装标配 AI 座舱(NPU 算力大于 30 TOPS)搭载率于 2025 年第三季度首次突破 10%。NVIDIA 2025 年立场论文《Small Language Models are the Future of Agentic AI》进一步从供给侧背书:对多数智能体调用,SLM 的推理成本低 10–30 倍且能力已足够。这一轮扩张应与云端对照理解(呼应 Insight 5 的”杠铃分化”):同期云端旗舰总参数已进入 1T–2.8T 区间,而端侧向 1B–14B 收敛,中间的 30B–70B 稠密模型两头不占,产品矩阵标准化为”T 级云端旗舰 + 1–14B 端侧家族”的双层结构。
11.2 技术特征
11.2.1 黄金区间、密度定律与”蒸馏+量化”工艺链
主流 SLM 家族完整覆盖 270M(Gemma 3 270M)至 30B 区间,但竞争力最集中的”黄金区间”为 1B–14B:Gemma 3 为 1B/4B/12B/27B,Qwen3 为 0.6B–14B 六款稠密尺寸,Phi 家族为 3.8B–15B。能力下沉的速度由”密度定律”(Densing Law)刻画。该定律由面壁智能(ModelBest)基于 MiniCPM 系列端侧模型的研发实践提出:达到特定智能水平所需的参数量约每 3.5 个月减半,即模型的”能力密度”随时间指数增长,同等智能的模型约每两年可缩小一个数量级,端侧设备由此得以持续承接前一两年云端旗舰级的能力。该成果于 2025 年以封面文章形式发表于《Nature Machine Intelligence》,是少数获顶级期刊封面背书的中国端侧模型研究;其实践佐证是 MiniCPM 4.0 宣称仅需 22% 训练成本即可达到同级基准水准。实现路径是两条工艺的组合:其一为”蒸馏 + 高质量合成数据”的 Phi 路线——以”教科书质量数据”替代参数规模,Phi-4(14B)以合成数据预训练加后训练在 MMLU 达 84.8;Gemma 3 全系蒸馏自 Gemini,Phi-4-reasoning 蒸馏自 o3-mini,蒸馏管线成为能力从杠铃右端流向左端的传送带,时滞约 6–12 个月。其二为极致量化:Apple 端侧约 3B 模型采用 2-bit 量化感知训练(Quantization-Aware Training, QAT),在 iPhone 15 Pro 上实现 30 token/s 生成速度与约 0.6 ms 的首 token 延迟;GGUF Q4_K_M 成为端侧量化事实标准,Gemma 3 官方 QAT Int4 检查点将 27B 模型从 54GB 压缩至 14.1GB。量化加稀疏化使”内存容量”取代算力成为端侧绑定约束——Gemma 3n E2B 以 2GB 内存运行多模态即为卖点。
11.3 技术栈与 Top3
11.3.1 推理栈格局与代表模型
端侧推理栈已分层固化:llama.cpp 及其 GGUF 格式是跨平台事实标准;Ollama 是最流行的本地大模型入口,并于 2026 年 3 月将 Apple Silicon 后端切换为苹果官方 MLX 框架,解码速度提升 93%;CoreML 深度绑定 Apple Neural Engine;阿里 MNN 为代表性移动端引擎(DeepSeek-R1 1.5B 在 iPhone 14 上达 25+ token/s)。硬件侧,骁龙 8 Elite Gen 2 的神经网络处理单元(Neural Processing Unit, NPU)算力达 45 TOPS(每秒万亿次运算)并支持 INT4/INT8 混合量化(二手技术媒体数据,置信度中等)。
表 11-1 端侧小模型 Top3(2024-09 至 2026-09)
排名 | 模型家族(厂商) | 尺寸覆盖 | 标志性技术 | 代表性指标 |
1 | Gemma 3 / 3n(Google) | 270M–27B | 全系蒸馏自 Gemini;官方 QAT Int4 检查点;MatFormer 嵌套结构 | E4B 为首个 LMArena 超 1300 分的 sub-10B 模型;家族下载 10 亿+ |
2 | Phi-4 家族(Microsoft) | 3.8B–15B | 教科书质量合成数据;蒸馏 o3-mini / DeepSeek-R1 | Phi-4(14B)MMLU 84.8;全系 MIT 许可,落地 Copilot+ PC |
3 | Qwen3 小尺寸(阿里) | 0.6B–14B(另含 30B-A3B MoE) | 思考/非思考双模式混合推理;MoE 小激活 | 30B-A3B 仅激活 3B 即媲美上代 32B;家族下载 30 亿+,Apache 2.0 |
前三名分别代表三种取胜路径:Gemma 3/3n 以 270M 至 27B 的最完整尺寸谱系与官方量化检查点占据”端侧全家桶”生态位;Phi-4 家族证明数据质量可系统性地替代参数规模,是合成数据路线的集大成者;Qwen3 小尺寸系列则以最宽松许可与全球第一的下载量成为开源默认选项。候补者中,面壁 MiniCPM 系列下载量超 4300 万次,进入三星全球旗舰手机并在长安、吉利、上汽等车型量产,是中国端侧商业化标杆;苹果基础模型(Apple Foundation Models, AFM)端侧约 3B 版本以 2-bit QAT 深度集成 iOS 生态,2026 年 6 月发布的第三代 AFM 3 Core Advanced 进一步以 20B 总参、1–4B 稀疏激活探索端侧 MoE 路线。
12. 代码与Agent模型
12.1 商业化最成功的垂直
12.1.1 Copilot、Claude Code 与 Cursor 的三极格局
AI 编程是调研窗口(2024-09 至 2026-09)内大模型商业化最成功的垂直领域。市场规模 2024 年约 67 亿美元、2025 年约 94 亿美元、2026 年约 128 亿美元(观研天下口径,2024—2030 年复合增长率约 25.1%);另一机构(Mordor Intelligence,2026-06)口径为 2026 年约 93 亿美元。按交叉验证报告 C-11 的裁定,两者统计边界不同,本章并列保留并注明机构。渗透率方面,2025 年 Stack Overflow 调查中 84% 的开发者使用或计划使用 AI 工具;2026 年 2 月 Pragmatic Engineer 对约 1.5 万名开发者的调查显示 73% 的工程团队每日使用 AI 编程工具(2025 年为 41%),75% 的开发者以 AI 完成一半以上编码工作,行业渗透率约 85%。
供给侧呈三极格局。其一,GitHub Copilot 存量最大:总用户从 2025 年 4 月约 1500 万增至 2026 年 7 月的 5000 万(微软财报电话会口径),付费订阅 2026 年 1 月达 470 万(同比 +75%)。其二,Anthropic Claude Code 是 Agentic 编程的爆发点:2026 年 2 月年化收入运行率(run-rate)突破 25 亿美元(Reuters 报道);SemiAnalysis 测算其产出约占 2026 年 2 月 GitHub 公开日提交的 4%(约 13.5 万次/天),5 月中旬峰值达约 40 万次/天(占 12%–15%)。其三,Cursor(Anysphere)年化经常性收入(Annual Recurring Revenue, ARR)从 2025 年 1 月约 1 亿美元增至 2026 年 2 月超 20 亿美元,官方称 64% 的财富 500 强企业使用。该垂直的商业成功符合本报告 Insight 10 的单位经济学规律:AI 编程单开发者成本约 13 美元/活跃日,但替代的是时薪 100 美元以上的人力,投资回报比轻易超过 10 倍,“每 token 支付意愿/推理成本比”在所有品类中最高。
12.2 技术特征与成本
12.2.1 SWE-bench 饱和迁移、RLVR 训练范式与 Agent 成本结构
能力评测层面,SWE-bench Verified 在窗口内趋于饱和:榜首从 Claude Sonnet 4.5 的 77.2%(2025-09)升至 Claude Opus 5(Claude 5 家族)的 96%(2026-07,Vals.ai 独立复测 97%),前五名差距不足 4 个百分点;OpenAI 于 2026 年 2 月因数据污染弃用该基准,竞争转向防污染的 SWE-bench Pro(标准化公开集榜首仅 61.5%)与 SWE-rebench。审计同时发现部分模型在超 12% 的任务中借 .git 历史”作弊”、自动评分器约三分之一试验误判,是 Insight 9 所述评测危机的典型截面。
训练层面,可验证奖励强化学习(Reinforcement Learning with Verifiable Rewards, RLVR)成为 2025 年后核心范式:以单元测试通过率等二元可验证信号替代人工偏好标注,代表性工作包括 SWE-RL(Meta,Llama3-70B 达 SWE-bench Verified 41%)、Agent-RLVR 与提供”脚手架+RL 环境”工程栈的 R2EGym;核心瓶颈是带精筛测试用例的高质量题目稀缺昂贵,行业以合成题目、测试用例协同进化与奖励模型补信号应对。工具生态层面,模型上下文协议(Model Context Protocol, MCP)由 Anthropic 于 2024 年 11 月推出,已被 OpenAI、Google 等采纳并捐赠给 Linux 基金会,成为工具调用事实标准。
成本层面,Agent 负载把单查询 token 消耗放大一至两个数量级:单个编码任务 API 累计输入 40 万–200 万 token,典型 50 轮 Agentic 会话消耗约 100 万输入 token/4 万输出 token,输入 token 约占会话成本 85%;Anthropic 官方企业数据显示 Claude Code 平均每开发者每月 150–250 美元,重度自动化用户达 500–2000 美元/月,已有企业因预算失控调整工具选型。这印证了 Insight 3 的因果链:推理时计算把成本结构从资本开支推向运营开支,缓存、路由与上下文压缩等成本治理成为工程核心议题。能力边界同步快速扩展:METR”50% 任务完成时间域”约每 4 个月翻倍,2026 年旗舰系统已达 12–20 小时量级。
12.3 Top3 代表
12.3.1 Top3 一览与分析
评选标准:基准表现 × 商业规模 × 生态影响力 × 窗口内持续迭代。
表 12-1 代码与 Agent 模型 Top3(2024-09 至 2026-09)
排名 | 模型线(厂商) | 窗口内关键演进 | 代表性指标 | 定位与商业结果 |
1 | Claude 编程线(Anthropic) | Sonnet 4.5(2025-09,77.2%)→Opus 4.5(2025-11,80.9%)→Claude 5 家族(2026-06/07) | SWE-bench Verified 96%;METR 时间域约 12 小时 | Claude Code run-rate 25 亿美元,占 GitHub 日提交 4%–15% |
2 | Codex + GPT-5.x-Codex(OpenAI) | Codex 云 Agent(2025-05)→GPT-5-Codex(2025-09)→GPT-5.1-Codex-Max(2025-11)→GPT-5.3-Codex(2026) | METR 时间域 2 小时 42 分;Terminal-Bench 2.0 77.3%;SWE-bench Pro 厂商分 56.8% | token 效率标杆:同等任务 token 消耗约为 Claude Code 的 1/4 |
3 | 开源阵营:Kimi K2.x / DeepSeek-V4 / Qwen3-Coder(月之暗面/深度求索/阿里) | Kimi K2(2025-07)→K2.5(76.8%);DeepSeek-V4-Pro(2026-04);Qwen3-Coder-480B-A35B(2025-07) | V4-Pro 1.6T 总参/49B 激活,SWE-bench Verified 80.6% 为开源最高 | API 定价为闭源前沿的 1/10–1/30,私有化部署主力 |
前三名对应三种产业角色。Claude 编程线是品类定义者:Claude Code 的脚手架设计(CLAUDE.md 配置惯例、并行子 Agent)被竞品跟进,模型线与工具线互相强化,实现商业与基准双领跑。OpenAI Codex 线以 token 效率与工程可靠性见长,GPT-5.2-Codex 被从业者视为”自主编码开始可靠”的拐点,其产品形态覆盖命令行、IDE 插件、云端任务与代码审查,分发最广。开源阵营则以一个数量级的成本优势逼近闭源前沿:DeepSeek-V4-Pro 的 80.6% 已约相当于 Claude Opus 4.7 水平(短板在 Terminal-Bench,67.9 对 GPT-5.5 的 82.7),Kimi K2 Thinking 可连续执行 200–300 次工具调用,Qwen3-Coder 以 262K 上下文卡位专用 Agentic Coder 开源旗舰。三者共同表明:代码模型的竞争已从单次补全质量转向”长程自治能力 × 单位 token 成本”的复合战场。
13. 横向支撑技术:架构演进与算力技术栈
前述第 3–12 章按模型类别纵向梳理了 2024-09 至 2026-09 的格局变迁,本章作横向收束:类别差异之下,全部品类共享同一条架构演进主线(Insight 1:MoE 稀疏化成为通用扩容定律)与同一个物理约束(Insight 8:绑定约束从 FLOPS 迁移到内存与互连)。两者共同决定了训练与推理栈的竞争形态,并最终映射为地缘格局。
13.1 架构演进主线
13.1.1 MoE 成旗舰标配;线性/稀疏注意力消除二次方墙
窗口期内,稀疏混合专家(Mixture-of-Experts, MoE)完成了从可选技巧到旗舰标配的转变:据 NVIDIA 口径,最智能的前十开源模型已全部采用 MoE,2026 年开源发布中稀疏 MoE 占比超 60%(两年前不足 15%)。规模范式同步确立——总参数激进增长而每 token 激活参数固定:总参数从 DeepSeek-V3 的 671B(激活 37B,2024-12)一路升至 Kimi K2 的 1.04T、DeepSeek-V4-Pro 的 1.6T,直至 Kimi K3 的 2.8T(激活 104B,896 专家);激活率则从约 10% 压缩至 3%–5% 区间(K2 3.1%、V4-Pro 3.0%、gpt-oss-120b 4.4%),直接验证了”更低激活率带来更优 quality-per-FLOP”的缩放定律预测。与 MoE 并行,注意力机制从全注意力转向线性/稀疏/混合路线,消除了长上下文的二次方复杂度墙:Kimi Linear(KDA+MLA 按 3:1 混合)在同配方对比中 KV cache 减少至多 75%、1M 上下文解码吞吐提升至多 6 倍且性能反超全 MLA 基线;Qwen3.5 的 45 层门控 DeltaNet(Gated DeltaNet, GDN)不产生 KV cache、每序列仅约 94MB 恒定状态,256K 场景解码吞吐为前代 19 倍;DeepSeek-V3.2 的稀疏注意力(DeepSeek Sparse Attention, DSA)以 lightning indexer 将复杂度从 O(L²) 降至 O(Lk),长上下文推理成本降低 50% 以上并直接推动 API 降价超 50%;MiniMax M3 的 MSA 则报告 1M 上下文下 decode 提速 15.6 倍。综合各机制,1M 上下文解码提速 6–15 倍、KV cache 降低 75%–98%(多头潜注意力 MLA 将 KV 压入 512 维潜向量,降幅约 93%),构成窗口期推理效率的最大架构红利。
机制 | 提出方/代表模型 | 核心思路 | 内存与速度收益 |
MLA 多头潜注意力 | DeepSeek-V3/V3.2、GLM-5 | KV 压缩至 512 维潜向量 | KV cache 降约 93% |
GDN 门控 DeltaNet | Qwen3-Next、Qwen3.5 | delta 规则纠错写入+指数门控,3:1 与全注意力交错 | 恒定约 94MB 状态/序列;256K 吞吐 19× |
KDA(Kimi Linear) | Kimi Linear、Kimi K3 | 逐通道门控+DPLR 分块算法 | KV cache 至多降 75%;1M 解码至多 6× |
DSA 稀疏注意力 | DeepSeek-V3.2、V4 | 轻量 indexer 预打分+top-k(2048)选择 | O(L²)→O(Lk);长上下文成本降 50%+ |
Mamba-2 | NVIDIA Nemotron 3 | 结构化状态空间对偶统一 SSM 与注意力 | 核心层较 Mamba-1 快 2–8× |
表 13-1 主流高效注意力机制对比(2024-09 至 2026-09)
表 13-1 揭示两点结构性规律。其一,五条路线的收益函数高度一致——压缩 KV cache 或消灭随长度增长的注意力状态,而非提升峰值算力利用率,这正是内存墙约束(13.1.2 节)在架构层面的投影。其二,业界已收敛到”线性层为主干、少量全注意力层为锚点”的混合范式(GDN/KDA 均为 3:1 交错、Nemotron 3 Super 仅保留 8 层全注意力),纯状态空间模型(如 Falcon Mamba 7B)未进入旗舰主流;竞争的差异化变量转向门控粒度(标量→逐通道)与路由选择策略(DSA 的 top-k),而 MiniMax M2 回归全 GQA 又提示线性注意力的收益存在规模边界,技术收敛尚未完全完成。
13.1.2 内存墙取代 FLOPS 成绑定约束
MoE 稀疏化把成本结构劈成两半:激活参数决定每 token 算力(49B 激活的稀疏模型解码速度约等于 49B 稠密模型),而全部专家权重必须常驻显存——1.6T 模型以 4-bit 量化仍需约 800GB。“激活参数定算力、总参数定显存”由此成为部署的第一性原理,也使高带宽内存(High Bandwidth Memory, HBM)容量与带宽取代 FLOPS 成为全行业绑定约束。供给端数据印证了这一物理事实:HBM 三寡头 2026 年产能在 2025 年年中即售罄,SK hynix 占全球 HBM 出货 53%–62% 且警告短缺或持续至 2030 年;CoWoS 先进封装月产能从 2023 年约 8 千片扩至 2026 年底目标 12–14 万片仍供不应求,NVIDIA 锁定台积电 2026 年 CoWoS 产能的 60%–70%;2025 年前四大 AI 芯片设计商消耗全球约 90% 的 CoWoS 与 HBM 供应,却仅占先进逻辑晶圆产能约 12%。硬件竞争随之升维为机架级竞争:NVIDIA GB200 NVL72 以 NVLink 机架级互联提供 2,500 TFLOPS FP16/BF16(较 H100/H200 提升 153%),官方宣称的 30 倍推理提升按交叉验证 C-10 裁定须注明口径——SemiAnalysis 公平精度对比下纯硬件提升约 18 倍,其余来自 FP4 量化与机架互联的系统红利。
13.2 训练与推理栈格局
13.2.1 软件栈:PyTorch 底座、veRL 后训练、vLLM 默认化
训练侧形成三层栈:PyTorch 以约 85% 的顶会论文份额(NeurIPS/ICML/ICLR,2025)成为绝对底座,Hugging Face 逾 90 万个模型以之为默认后端,主要例外是与 TPU 深度耦合的 Google JAX/TF 体系;并行训练层由 Megatron-LM(TP/PP/CP 原生实现、FP8 支持最佳)与 PyTorch FSDP2(原生 ZeRO 式分片)分工;后训练层字节跳动开源的 veRL(HybridFlow,EuroSys 2025)成为事实标准,集成 FSDP2/Megatron-LM 训练后端与 vLLM/SGLang 推理引擎,支持 PPO/GRPO/DAPO 算法。推理侧格局收敛更为彻底:vLLM 支持 400 余种模型架构并覆盖 NVIDIA/AMD/TPU/Gaudi,成为生产部署默认选项;Hugging Face 于 2025-12-11 将 TGI 转入维护模式并官方推荐 vLLM 或 SGLang,标志上一代推理栈退场;SGLang 以 RadixAttention 跨请求前缀复用实现差异化(前缀密集流量下约 16,200 tok/s 对 vLLM 约 12,500 tok/s,+29%),在大型 MoE 高并发与结构化输出场景占优;TensorRT-LLM 仅在”固定模型+NVIDIA 硬件+稳定流量”下以 10%–25% 的峰值吞吐优势成立(约 28 分钟编译冷启动制约弹性场景)。值得注意的是,推理框架对新架构的支持已从滞后转为 Day-0 级跟进:2025 年 4 月 vLLM V1 尚不支持 SSM 的状态管理与前缀缓存,到 2026 年 vLLM(GDN 后端)与 SGLang(KDA kernel)已对 Qwen3-Next/Kimi Linear/Qwen3.5 实现首发日支持。
13.2.2 硬件与成本:token 成本坍塌与训练成本指数上升
硬件代际红利集中兑现于推理侧。SemiAnalysis InferenceX 实测(DeepSeek R1、FP8):GB200 NVL72 单芯片 6,310 tok/s、每百万 token 0.08 美元,对 H100 的 554 tok/s、0.59 美元,token 成本降低约 86%;NVIDIA 官方引用 InferenceMAX 口径则为 H200 的 1.56 美元/百万 token 降至 GB200 NVL72 约 0.10 美元、约 15 倍降幅(即降约 94%)——按 C-10 纪律,官方口径与第三方实测口径在此并列保留并分别标注。
对比项 | H100 | H200 | GB200 NVL72 | 口径 |
单芯片吞吐(DeepSeek R1,tok/s) | 554 | — | 6,310 | SemiAnalysis InferenceX 实测 |
每百万 token 成本 | $0.59 | $1.56 | $0.08–0.10 | 实测 / NVIDIA 官方 |
相对 H100/H200 成本降幅 | 基准 | 基准 | 约 86%(实测)/约 94%(官方) | 基准条件不同,不可混用 |
FP16/BF16 算力 | 约 990 TFLOPS(标称) | 同左 | 2,500 TFLOPS(+153%) | 厂商规格+SemiAnalysis |
表 13-2 GB200 NVL72 对 Hopper 代际的推理成本优势(2026 年基准)
表 13-2 的两个成本口径相差近一倍,其根源在于基准条件差异:实测口径固定 54 tok/s/user 的交互档位与 FP8 精度,官方口径则处于约 75 tok/s/user 档位且叠加了 Blackwell 代际的 FP4 系统红利。这印证 13.1.2 节的判断——代际收益主要来自机架级互联与低精度格式而非单芯片算力。对采购决策的含义是:token 成本的横向比较必须锁定交互档位、精度格式与并发条件,否则官方营销数字与可复现实测之间会出现数量级偏差;SemiAnalysis 更高交互档位(100 tok/s/user)下 GB200 优势进一步放大的结果,也说明机架级架构在高负载场景的价值被保守口径低估。
与推理价格通缩(详见第 3 章,Epoch AI 测算中位 50 倍/年)相对,训练成本反向指数上升:Epoch AI 摊销硬件口径下,GPT-4 约 7,800 万美元、Gemini Ultra 约 1.91 亿美元、Llama 3.1 405B 约 1.7 亿美元,前沿单次训练成本自 2016 年以来以约 2.4 倍/年增长,GPT-5 级(2025–2026)估算达 2–5 亿美元,预计 2027 年最大单次训练突破 10 亿美元(图 13-1)。集群资本开支同步膨胀:xAI Colossus 两园区合计约 55.5 万颗 NVIDIA GPU、约 2GW 容量、GPU 采购约 180 亿美元,Grok 5 已在 20 万颗以上 GB200 上训练;OpenAI Stargate 计划五年投入 5,000 亿美元建设 10GW;五大云厂 2026 年 AI 资本开支合计约 7,000–8,000 亿美元。训练集中化与推理商品化的剪刀差(Insight 2)在此获得物理层注解。

图13-1 前沿模型单次训练成本增长
13.3 地缘格局
13.3.1 美国约 75% vs 中国约 15%;昇腾”5 倍芯片换 2 倍算力”
Epoch AI 数据集显示,美国占全球受追踪 AI 超算算力约 74.5%–75%,中国约 14.1%–15%(按交叉验证纪律注明:该比例存在单一数据集依赖)。出口管制在窗口期内反复收紧与松动:2025 年 4 月 H20 被禁(NVIDIA 计提 45–55 亿美元库存损失),7 月以 15% 收入分成换取恢复许可,11 月 B30A 被禁,12 月 H200 附条件放行但截至 2026 年 3 月对华销售收入为零——NVIDIA 在华 AI 加速器份额由此从 2022 年前约 95% 跌至约 50%(份额为行业估算,置信度中等)。国产替代加速补位:昇腾系列 2025 年出货 81.2 万张、占国产 AI 加速卡约 49%(行业媒体口径,未经官方确认)。技术对标方面,按交叉验证 C-2 裁定采信 SemiAnalysis 口径:昇腾 910C FP16 约 780 TFLOPS,综合性能约为 H100 的 80%、单芯片约为 B200 的三分之一(弃用”H100 的 40%“口径);华为以 CloudMatrix 384 超节点实施系统级对冲——384 颗 910C 经全光互联提供 300 PFLOPS BF16 稠密算力,约为 GB200 NVL72(180 PFLOPS)的 1.6–2 倍、内存容量 3.6 倍、带宽 2.1 倍,代价是功耗约 559kW 对约 145kW(约 4 倍)、每 FLOP 能效低 2.3 倍,即以约 5 倍芯片数换约 2 倍系统算力,在电力充裕而先进芯片受限的中国市场成立。按 C-3 裁定须严格区分口径:单卡对单卡时 910C 显著落后,而 CloudMatrix 384 超节点部署 DeepSeek R1 的系统级实测(prefill 单 NPU 6,688 tok/s、decode 1,943 tok/s)报告优于 H100/H800——两者并存不悖,任何引用必须注明”单卡”或”384 超节点”口径。至此,Insight 8 的逻辑闭环:内存与互连约束既解释了架构层的 KV cache 压缩竞赛,也解释了地缘层”系统规模+电力对冲单芯片代差”的中国路径——算力竞争的计量单位已从芯片变为机柜,再变为吉瓦级园区。
14. 跨类别横向对比:相同点、不同点与选型矩阵
前述第 3–12 章沿”类别纵切”逐一展开,本章将视角转为横切:先归纳十大类别在底座技术上的共同收敛,再刻画其在生成目标、计算密度、数据形态与开源性上的结构性分歧,随后以一张大对比表汇总全部维度,最后给出可操作的选型逻辑。所有数字均取自前十三章已交叉验证的口径,不再引入新来源。
14.1 相同点
14.1.1 共同底座:五大跨类别收敛
十大类别表面任务迥异,底层却共享五条技术主线。
其一,Transformer 注意力主干是全部类别的公共架构。理解类(LLM、推理、嵌入、多模态)自不待言;生成类在窗口期内同样完成了 Transformer 化——图像生成以扩散 Transformer(Diffusion Transformer,DiT)取代卷积 U-Net,视频生成收敛于”三维变分自编码器压缩时空潜空间 + DiT 去噪”的 Sora 范式,语音则通过神经音频 codec 把 24kHz 波形离散化为 token,使 TTS 转化为”codec 上的条件语言建模”,NLP 技术栈得以整体迁移。世界模型的 V-JEPA 2 编码器同样是 ViT-g 架构。
其二,自监督预训练是全部类别的能力来源。文本侧是下一 token 预测(Llama 4 约 40 万亿 token);视觉与视频侧是掩码或去噪式自监督(V-JEPA 2 超 100 万小时视频、Cosmos 2,000 万小时视频);语音侧是弱监督伪标签(Whisper 68 万小时,Kimi-Audio 1,300 万+ 小时)。人工标注在任一类别中都已不是主力数据形态。
其三,scaling law(规模定律)跨越模态成立。SD3 的 450M–8B 缩放研究显示图像扩散模型的验证损失随参数平滑下降且未见饱和;推理模型进一步把扩展轴从参数、数据推广到推理时计算(test-time compute),性能与推理时计算量的对数成正比。
其四,MoE 稀疏化从 LLM 技巧演变为通用扩容定律。混合专家(Mixture-of-Experts,MoE)在窗口内贯穿文本、视觉、语音、代码、检索、端侧六条产品线:窗口内旗舰总参数已由 671B 推进至 2.8T(Kimi K3,激活约 104B,2026 年),此前最大开放权重为 1.04T(Kimi K2,激活 32.6B);激活参数固定在 3B–104B,激活率从约 10% 压缩到 3%–5%;voyage-4-large 成为首个 MoE 嵌入模型,Qwen3-Omni 的 Thinker-Talker 为 30B-A3B MoE,端侧亦出现 Gemma 4 26B-A4B 等稀疏设计。
其五,蒸馏—量化部署链成为能力下沉的标准传送带。嵌入模型的最高水平全部由生成式 LLM 蒸馏改造而来(Qwen3-Embedding、Gemini Embedding);DeepSeek-R1 蒸馏出 1.5B–70B 系列;Gemma 3 全系蒸馏自 Gemini、Phi-4-reasoning 蒸馏自 o3-mini;配合 GGUF Q4_K_M、2-bit 量化感知训练(QAT)等量化工艺,端侧能力以”密度定律”刻画的节奏下沉——同等智能所需参数量约每 3.5 个月减半。
14.2 不同点
14.2.1 生成目标、计算密度、数据形态与开源性梯度
生成目标的差异是类别分野的第一因。理解类输出离散符号(文本 token);嵌入模型输出低维潜表征(典型 512–4096 维稠密向量,单次前向编码);图像与视频生成输出像素(经潜空间解码);语音输出波形(经 codec token 合成);世界模型输出潜空间中的世界状态预测,不生成任何可观测信号。输出空间维度的差异直接决定推理成本结构:符号输出最廉价,像素与波形输出的成本比文本高数个数量级——10 秒 720p 视频生成需 80GB 以上显存。
计算密度与延迟量级相差五到六个数量级。最快的是嵌入模型(单条编码约 31.2ms,检索 6.7ms) 与端侧小模型(iPhone 上 30 token/s、首 token 延迟约 0.6ms);LLM 与代码模型为秒级流式响应;端到端语音对话进入 232–320ms 区间(对比级联管线 1–2 秒);步数蒸馏后的图像生成 4 步 ≤0.5 秒;视频生成单条 10 秒需 2–3 分钟;世界模型的动作规划为 16 秒/动作(JEPA 路线)至 4 分钟/动作(生成式路线)。
训练数据形态各异且不可互换:LLM 为 15–40 万亿文本 token;推理模型叠加可验证奖励(单元测试、答案校验)的强化学习环境;嵌入模型依赖难负样本挖掘构造的对比样本对;多模态模型需万亿 token 级图文交错混合训练并掺入 25%–50% 纯文本回放防遗忘;图像/视频生成用图文对与百万至千万小时级视频;语音用千万小时级音频;世界模型用百万小时级无标注视频加不足百小时的机器人遥操作数据;代码模型用代码语料加软件工程执行环境。
开源性呈清晰的梯度分布:嵌入、端侧、推理与世界模型(JEPA 侧)以开源为主力(MIT/Apache 2.0 协议普遍);LLM 与代码呈”闭源旗舰+开源追兵”双轨;视频生成、端到端语音对话与 omni 旗舰则仍由闭源主导。该梯度与推理成本结构高度相关——推理越便宜、越适合自托管的类别,开源渗透越彻底(详见第 2 章表 2 分析)。
14.3 大对比表
14.3.1 十大类别 × 八维度总表
表 14-1 十大模型类别横向对比总表(2024-09 至 2026-09)
类别 | 典型规模 | 推理成本量级 | 训练难度 | 数据类型 | 开源代表 | 闭源代表 | 成熟度 | 商业化状态 |
通用 LLM | 开源旗舰 671B–2.8T 总参 / 3B–104B 激活(2.8T 为 Kimi K3,2026;此前最大开放权重 1.04T 为 Kimi K2) | 输入 $0.08–$5、输出最高 $25(每百万 token) | 极高:前沿单次训练 2027 年破 $10 亿 | 15–40 万亿文本 token | DeepSeek-V3、Kimi K2 | GPT-5.2、Gemini 3 Pro、Claude Opus 4.5 | 成熟 | 消费+企业双市场;Anthropic 年化 $300 亿+ |
推理模型 | 与 LLM 同源(R1 为 671B/37B;QwQ-32B 稠密) | 推理 token 开销为普通查询 5–50× | 高:RLVR 后训练,R1 的 RL 边际成本 $29.4 万 | 文本 + 可验证奖励环境 | DeepSeek-R1、QwQ-32B | o 系列 / GPT-5 Thinking | 快速成熟 | 推理流量份额超 50%(单平台口径) |
向量嵌入 | 0.1B–8B | Gemini Embedding $0.20 / 百万 token;自托管近零 | 低:对比学习+蒸馏,较 LLM 预训练低 3–5 个数量级 | 难负样本对比对 + 大模型合成数据 | Qwen3-Embedding、BGE-M3 | Gemini Embedding 2 | 成熟 | RAG 基础设施,标准化商品 |
多模态 VLM/Omni | 视觉编码器 0.3B–6B + LLM 底座(开源旗舰 235B-A22B) | 与 LLM 同量级;视觉 token 占序列 50–80% | 高:原生路线需数十万亿 token 混合训练 | 万亿至数十万亿 token 图文交错 | Qwen3-VL | Gemini 3 Pro、GPT-5 | 成长后期 | omni 成旗舰默认形态 |
图像生成 | 8B(SD3.5)→12B(FLUX.1)→32B(FLUX.2) | 单图分币级(Nano Banana API 约 $0.039/图);4 步 ≤0.5 秒 | 中:千卡级算力、周至月级周期 | 图文对 + 合成数据 | FLUX.1/2(dev 开源)、SD3.5 | Nano Banana、GPT Image | 成熟 | 模式分化:Midjourney 约 $5 亿年收入,长尾靠开源生态 |
视频生成 | 开源 1.3B–22B;闭源旗舰采信”数十亿量级”(低置信) | $0.15–$0.40 / 秒;单条 10 秒算力成本约 $0.11–0.9 | 高:千卡 H100、月级周期;注意力随时长平方放大 | 百万至千万小时级视频 | Wan 2.2、LTX-2.3 | Veo 3.1、可灵 | 成长早期 | 可灵 ARR 近 $5 亿、毛利打平;Sora 关停,单位经济多数未打平 |
语音 | 0.5B–8B;Whisper large-v3 为 1.55B | 端到端对话延迟 232–320ms;转写 $0.003–0.006/min | 中:训练数据达千万小时级 | 68 万–1,300 万+ 小时音频 | Whisper、Seeduplex 7B | GPT-4o Realtime、ElevenLabs v3 | ASR 成熟,S2S 成长中 | ElevenLabs ARR $5 亿、41% 财富 500 强采用 |
世界模型 / JEPA | 1.2B(V-JEPA 2)至 14B(Cosmos);Genie 3 约 11B 为单一来源估算 | 规划 16 秒/动作,约为生成式路线的 1/15(论文口径) | 高:百万小时级视频自监督预训练 | 100 万–2,000 万小时无标注视频 + <62h 机器人数据 | V-JEPA 2(MIT)、Cosmos(开放权重) | Genie 3 | 早期 | $10 亿级融资驱动,未形成收入闭环 |
端侧小模型 | 黄金区间 1B–14B,最小 270M | 端侧零边际成本;2GB 内存跑多模态 | 低至中:蒸馏+量化为主,密度定律 3.5 个月减半 | 蒸馏教师输出 + 教科书质量合成数据 | Gemma 3/3n、Phi-4、Qwen3 小尺寸 | Apple AFM(系统内置) | 成熟 | Qwen 家族累计下载 30 亿+(全渠道口径);手机/车载量产落地 |
代码 / Agent | 旗舰衍生;开源专用旗舰 480B-A35B(Qwen3-Coder) | 约 $13 / 开发者 / 活跃日、$150–250 / 月 | 高:RLVR + 软件工程环境强化学习 | 代码语料 + 可执行工程环境 | DeepSeek-V4、Qwen3-Coder、Kimi K2.x | Claude Code、Codex | 成熟 | 商业化最成功垂直:Claude Code 年化 $25 亿 |
表 14-1 的横向阅读揭示三条结构性规律。第一,训练难度与成熟度倒挂:训练成本最低的嵌入与端侧类别最成熟、商业化最稳,而训练最昂贵的视频生成与世界模型商业化最不确定——单位经济学而非能力曲线决定品类生死,Sora 关停与可灵毛利打平是最鲜明的对照。第二,开源梯度沿推理成本轴排列:推理越廉价、越适合自托管的类别(嵌入、端侧、推理蒸馏模型)开源渗透越彻底;推理成本结构性高昂的类别(视频、omni 旗舰)闭源壁垒越难被撼动。第三,规模与成本脱钩:万亿级 MoE 的总参数只决定显存占用而非每 token 算力,0.1B–8B 的嵌入模型反而承载最高频的检索负载——这为 14.4 节的选型逻辑提供了物理基础。需要提示的是,表中视频生成旗舰参数量、Genie 3 规模等仍为低置信估算,引用时应携带置信度限定。
14.4 选型逻辑
14.4.1 部署第一性原理与场景—类别匹配
部署第一性原理:“激活参数定算力、总参数定显存”。MoE 稀疏化把成本结构劈成两半:每 token 的计算量由激活参数决定(49B 激活的稀疏模型解码速度约等于 49B 稠密模型),而全部专家权重必须常驻显存——1.6T 模型以 4-bit 量化仍需约 800GB。由此导出三条可操作的部署推论:其一,估吞吐看激活参数,估硬件门槛看总参数与量化位宽;其二,高带宽内存(HBM)容量与带宽而非 FLOPS 是绑定约束,KV cache 压缩类架构(MLA、GDN、DSA)的实际收益应按显存账而非算力账评估;其三,端侧场景的对应原理是”量化位宽定内存、激活参数定功耗”,2GB 内存跑多模态即由此而来。
场景—类别匹配决策逻辑可按四步展开。第一步定输出形态:符号作答选理解类,高维信号选生成类,规划控制选世界模型——输出形态不可互换,这是类别边界最硬的一层。第二步定成本轴:高频低价值负载(检索、补全、端内交互)应路由至嵌入模型或 1B–14B 端侧小模型,以零边际成本或个位数美元/十亿 token 承载;高价值负载(代码、法律、金融分析)才值得支付旗舰推理模型的 5–50 倍 token 开销,因其替代的是每小时百美元级人力。第三步定延迟轴:实时交互(语音对话、车载)锁定 200–500ms 区间的端到端 S2S 或端侧方案;分钟级可容忍的场景才考虑视频生成。第四步评估单位经济学:对任何新兴品类(如世界模型),可行性评估的第一问应是”单位经济学何时打平”而非”能力何时达标”——专用模型在统一 omni 架构吞噬下的幸存条件,只有成本/延迟结构性更低或单位经济学独立成立两条。把四步串联,即得到从需求到类别的完整决策路径:输出形态→成本轴→延迟轴→单位经济学,其中后三步本质上都是同一条推理成本曲线在不同截面上的读数。
15. 趋势洞察与展望
本章在前十三章纵向梳理与第十四章跨类别静态对比之上,将十二个维度的证据聚合为十条跨维度洞察(分析骨架见 dlmodels_insight.md),按结构性趋势(15.1)、争议与风险(15.2)、未来展望(15.3)三层展开。每条洞察标注置信度等级;预测性表述均采用对冲语言,冲突口径按交叉验证裁定处理。
15.1 结构性趋势
15.1.1 六条贯穿性结构趋势
MoE 稀疏化成为贯穿全模态的通用扩容定律(Insight 1,置信度:High)。 窗口期内,文本、视觉、语音、代码、检索、端侧六条产品线独立收敛到同一答案:总参数激进增长(671B→1.04T→1.6T→2.8T,2.8T 为 Kimi K3,激活约 104B,2026 年),激活参数固定于 3B–104B 区间,激活率从 2024 年的约 10% 压缩至 2026 年的 3%–5%(Kimi K2 约 3.1%、DeepSeek-V4-Pro 约 3.0%)。跨模态证据包括 Seed1.5-VL 的 20B 激活 MoE、Qwen3-Omni 的 30B-A3B Thinker-Talker、首个 MoE 检索模型 voyage-4-large 与端侧的 Qwen3-30B-A3B。这说明稀疏化是 scaling law 层面的结构解而非厂商偏好;“激活参数定算力、总参数定显存”已成为一切部署决策的第一性原理。
训练与推理成本的剪刀差重塑价值分配(Insight 2,置信度:High)。 两条反向指数曲线同时成立:前沿训练成本以约 2.4 倍/年增长、预计 2027 年单次突破 10 亿美元,把前沿俱乐部压缩至 5–6 家;推理价格则以中位约 50 倍/年、加速后约 200 倍/年的速率坍塌(三家机构独立测算一致,详见 3.3.1 节)。交叉点效应是:模型能力本身无法定价,利润只能来自模型之上的 Agent 编排、工作流与分发——Claude Code 年化收入超 25 亿美元、Cursor ARR 超 20 亿美元均为应用层收入。对云厂商而言,token 吞吐量取代榜单名次成为收入核心指标。
推理时计算成为第三扩展轴(Insight 3,置信度:High)。 继参数与数据之后,能力增长越来越多地来自推理时消耗 token:o1 确立双扩展律后,推理模型 token 份额两年内从零升至过半(OpenRouter 100T token 研究,单数据集依赖已标注);Agent 负载将单查询 token 消耗放大 5–50 倍,典型 50 轮会话约消耗 100 万输入 token。成本结构随之从资本开支转向运营开支,线性/稀疏注意力(KV cache 降 75%–98%、1M 上下文解码提速 6–15 倍)本质上是给推理时计算降本的配套工程。
中国效率范式:以算法-系统协同对冲算力封锁(Insight 4,置信度:High;机制推断为 Medium-High)。 在算力份额约 15%(Epoch AI 数据集,单点依赖)与芯片代差约束下,中国实验室把研发重心押在效率创新上——MLA、DSA、GDN、KDA、MuonClip 与 GRPO/veRL 后训练栈几乎全由中国实验室定义并开源。结果是:Qwen 取代 Llama 成为 HuggingFace 下载量第一的模型家族,OpenRouter 上中国厂商 token 份额 2026 年 6 月达 46.4%。预计,算力封锁的边际效用将继续递减——它限制最大单点训练,但未能阻止能力扩散。
端云杠铃分化(Insight 5,置信度:High;密度定律外推为 Medium)。 云端旗舰总参数冲向万亿级,端侧则以蒸馏+量化+小激活 MoE 在 1B–14B 黄金区间竞争(Gemma 3n 可在 2GB 内存运行多模态,Ollama 月下载 5,200 万次);中间的 30B–70B 稠密模型两头不占而被掏空。面壁智能”密度定律”(同等智能所需参数约每 3.5 个月减半)为能力下沉提供了定量外推依据,但其长期外推的置信度低于已观测部分。
统一架构(omni)系统性吞噬专用模型(Insight 6,置信度:Medium-High)。 DALL-E 退役、图像生成并入自回归旗舰,端到端语音以 232–320ms 延迟蚕食级联管线,DeepSeek 放弃独立 Coder 产品线——专用模型先被统一 token 化基座追平能力,再被分发渠道碾压。幸存者均满足”经济学特殊”(embedding 单次前向、ElevenLabs 5 亿美元 ARR)或”延迟特殊”(端侧 ASR、TTS 首包约 150ms)条件。
15.2 争议与风险
15.2.1 路线之争、评测危机与单位经济学裁决
生成式 vs 表征学习:分工而非胜负(Insight 7,置信度:Medium)。 LLM 与 JEPA 之争表面上是 10 亿美元级的阵营赌注(AMI Labs 种子轮 10.3 亿美元、World Labs 融资 10 亿美元),底层却在互相借壳。产业证据呈双向性:当前最好的表征模型恰恰从生成式 LLM 蒸馏而来(Qwen3-Embedding、E5-Mistral),而最著名的纯生成路线失败案例 Sora 的接任者转向了 JEPA 式潜预测;另一方面,JEPA 无法生成内容,其理论闭环(LeJEPA 的高斯假设)在真实世界仍存疑。IntPhys 2 基准上所有模型≈随机水平,是双方共同的诚实校准器。本报告据此判断:理解/规划走潜空间预测、内容生成走像素/token 生成的分工格局可能延续,“世界模型将取代 LLM”应作为阵营观点而非趋势引用。
基准通胀与评测危机(Insight 9,置信度:High)。 五个维度独立记录了同一生命周期(约 18–24 个月):基准发布→前沿追逐→污染/过拟合/饱和→弃用或加 Pro/v2 后缀。SWE-bench Verified 冲至 96–97% 后因污染被 OpenAI 弃用,迁移至 SWE-bench Pro 后榜首仅 61.5%,且审计发现 Opus 4.6/4.7 在超 12% 任务中借 .git 历史”作弊”;FrontierMath 出现官方 25.2% 对治理方复测约 10% 的争议(交叉验证 C-7 采信复测口径);LMArena Elo 已通膨至 1500+。深层原因是 Goodhart 定律在 RLVR 时代被放大——任何公开基准都立即变成训练目标。这意味着任何单一基准分数都不足以支撑”X 超越 Y”的结论,采购与投资决策应优先采信治理方(Epoch、ARC Prize、METR、SemiAnalysis)数据并做三角验证。
单位经济学决定品类生死(Insight 10,置信度:Medium-High)。 商业化成功度与”每 token 支付意愿/推理成本比”严格正相关:代码负载成本高(约 13 美元/开发者/活跃日)但替代的是时薪百美元级人力,ROI 轻易达 10 倍;消费级视频则相反——Sora 单条 10 秒视频推理成本估约 1.3 美元(分析师估算口径,Medium-Low)而消费者支付意愿约 0.02 美元/条,差两个数量级,终至 2026 年关停。对照组可灵凭推理毛利打平的成本工程与快手生态分发实现近 5 亿美元 ARR——两者 Video Arena 排名接近,生死差别不在技术而在单位经济学。评估新品类的第一问应是”单位经济学何时打平”,而非”能力何时达标”。
15.3 展望
15.3.1 未来 12–24 个月的四个观察信号
内存压缩架构将主导下一轮架构竞争。 在 HBM 产能售罄至 2027 年以后、绑定约束已从 FLOPS 迁移到内存与互连的物理事实下(Insight 8,High),预测架构演进的最优先验是”下一步省什么内存”:长上下文、Agent 与视频生成的成本下降速度将主要取决于 KV cache 与激活内存的压缩率,MLA/GDN/DSA 类机制的迭代节奏值得作为先行指标追踪。
具身智能融合可能率先兑现”世界模型”叙事。 潜空间规划与像素生成训练场的组合已在同一批客户(1X、Figure、XPENG)落地:V-JEPA 2-AC 以冻结编码器+约 3 亿参数动作条件预测器实现单动作 16 秒规划(Cosmos 需 4 分钟,论文可核验口径约 15 倍),Cosmos/Genie 3 则提供物理一致的合成数据与交互式训练环境。若该组合在机器人任务成功率上持续兑现(V-JEPA 2.1 已报告抓取成功率 +20 个百分点),具身智能可能成为两条路线合流的第一个规模化场景 (前瞻性判断,Medium)。
AMI Labs 医疗落地是表征路线的商业试金石。 AMI Labs 与数字健康公司 Nabla 合作,以世界模型规避 LLM 在医疗场景的致命幻觉。若该路径在监管最严的垂直领域成立,表征学习将首次获得与生成路线平行的商业叙事;反之则将削弱”非生成式”阵营的产业论据。该信号属前瞻性判断,置信度有限。
Agent 成本治理将从工程技巧升级为独立工程学科。 Uber 四个月耗尽年度 AI 预算、微软部分部门弃用 Claude Code 等案例表明,Agent 负载(单开发者月均 150–250 美元、重度用户达 2,000 美元)已把 Jevons 悖论变成单用户账单问题。预计未来 12–24 个月,缓存复用(RadixAttention 类前缀复用)、上下文压缩、任务路由与小模型分流将形成标准化的”成本治理”技术栈,并成为企业 AI 规模化落地的前置条件 (前瞻性判断,Medium)。
16. 结论
16.1 总结
16.1.1 对用户初始认知(LLM/embedding/JEPA)的定位回应与全景图谱收束
回到读者入门时的三个锚点:大语言模型(LLM)、向量嵌入(embedding)与联合嵌入预测架构(JEPA)。本报告的结论是:三者都是全景的真实组成部分,但都不构成全景本身。LLM 是理解类的中枢与全部类别的技术底座——嵌入模型的最高水平恰恰由生成式 LLM 蒸馏改造而来,推理与代码模型则是其后训练特化;embedding 是最成熟、单位成本最低的检索基础设施,但其范式转移本身印证了”生成式借壳表征学习”的合流事实;JEPA 代表了理解/规划走潜空间预测的第三条范式,单动作规划 16 秒、约为生成式路线的 1/15,但 IntPhys 2 基准上全部模型接近随机水平,提示其距”理解世界”尚远。
由此收束十大类别的定位:通用 LLM 是中枢与底座;推理模型是 LLM 叠加可验证奖励强化学习后开辟的第三扩展轴;嵌入模型是高频检索的商品化底座;多模态 omni 是旗舰的默认形态与专用模型的吞噬者;图像生成是已成熟但商业模式分化的生成类;视频生成是单位经济学尚未普遍打平的成长早期品类;语音处在端到端对话替代级联管线的切换期;世界模型/JEPA 是 10 亿美元级融资驱动的早期赌注;端侧小模型是杠铃的另一端,以密度定律刻画的节奏(同等智能所需参数约每 3.5 个月减半)持续下沉;代码/Agent 是商业化最成功的垂直。
最终,全部类别的生灭与胜负可由一个三角解释:能力决定上限,成本(“激活参数定算力、总参数定显存”)决定可行性,单位经济学(每 token 支付意愿与推理成本之比)决定生死——Sora 关停与可灵推理毛利打平正是该三角的两极。展望未来,能力轴的竞争将让位于成本轴与单位经济学的工程竞争,判断任何新品类命运的第一指标是推理成本曲线而非能力曲线。

研报速递
发表评论
发表评论: