花旗研报:模型成本降了 55%,但 61% 的钱花在了缓存上模型能力的仗还在打,成本账先变了。据花旗研报等外部分析机构数据,前沿模型推理成本正快速下探:专有模型任务成本同比前代下降55%,能力打分只提升9%;开源模型任务成本降到$0.80,周环比下降35%,相对闭源的价格折扣从40%扩大到60%。价格靠拢,能力差距却没收窄——闭源对开源的智能领先从9分拉大到12分。美欧混合token价格周环比下降25%,专有模型发布节奏平均每周20个,比此前五周峰值的12个高出67%。真正值得看的不是降幅,而是钱花在哪。研报给出的关键数字是:缓存相关操作已占任务成本的61%。模型"思考"本身的开销被压得差不多了,大头转移到上下文的搬运与复用。研报认为,下一阶段推理效率的提升会来自"以更低边际成本提供更多上下文"——谁能把缓存这层做得更省,谁就能在同价下给出更多上下文。另一个现象是:基座模型不必从头重造。小米MiMo-V2.6-Pro在现有基座模型上投入约260万美元、6天强化学习训练,就产出了高水平开源模型。成本门槛降下来,竞争焦点正从"训练出什么"转向"推理时怎么组织上下文"。对使用者最直观的变化是:同样预算能跑更多任务、更长的上下文。
发表评论
发表评论: