2026年8月,全球大模型赛道迎来了一场罕见的"超级发布周"——从8月3日的阿里Qwen3.8-Max,到8月12日至13日的DeepSeek-V4-Pro、Grok 4.6、Gemini 3.7 Flash与GPT-5.6 Ultrafast,多家实验室在短短两周内集中亮出血统各异的旗舰型号。本轮竞赛的关键词不再是单纯的"更大参数",而是推理成本、开源策略与专用推理硬件的多重竞争。
Qwen3.8-Max:2.4万亿参数的国产旗舰开源
8月3日,阿里巴巴发布新一代基础大模型Qwen3.8-Max。该模型参数总量高达2.4万亿,采用稀疏混合专家(MoE)架构,单次推理激活约950亿参数,支持最长100万Token上下文,并原生集成多模态视觉理解。值得注意的是,这是Max级别旗舰模型首次面向公众开放源代码,协议采用Apache 2.0。据披露,其每百万输出Token推理成本约6美元,远低于行业主流旗舰50美元的水平,被业内视为"开源+极致性价比"路线的又一次提速。
Gemini 3.7 Flash与Grok 4.6:代码能力与Agent循环之争
8月13日,Google DeepMind发布Gemini 3.7 Flash,其在FrontierCode 1.1 Main编码基准上从34.4%大幅提升至43.6%,DeepSWE v1.1从49.0%跃升至65.3%,上下文窗口1M Token。年末前该模型定价约为原3.6 Flash的一半,明显走价格攻势。同日,xAI发布Grok 4.6,主打更长Agent循环与知识工作,GDPVal-AA v2 Elo达到1753,较4.5提升227分,并新增2倍加速的Priority Processing通道。两者分别押注"通用编码"与"深度Agent任务"两个方向。
GPT-5.6 Ultrafast:专用推理硬件的另一条路
8月13日,OpenAI上线GPT-5.6 "Ultrafast"预览版,搭载在新一代Cerebras硬件上,Sol模型推理速度最高提升至常规的14倍,目前以限量预览形式提供服务且未公布定价。这标志着大模型竞争从"模型算法"延伸到"专用推理芯片"维度——推理速度本身正在成为产品差异化指标,算力供给侧的技术路线也变得更加多样。
算力与价格的再平衡
这一轮发布的另一条暗线是价格与算力的再平衡。8月17日零时起,DeepSeek-V4系列API启用全新峰谷定价,V4-Pro高峰时段输出价格从此前的6元涨至27元/百万Token,涨幅达350%,缓存命中输入价格涨幅更超过1100%。官方解释称Agent应用爆发使调用量激增,长期低价难以为继。显然,在模型能力快速升级的同时,定价机制正走向更精细的峰谷与成本传导,企业需要把推理成本建模纳入技术选型。