2026年8月26日,阿里巴巴(通义千问 / Alibaba Cloud)正式发布开源多模态MoE模型Qwen3.8-Flash。官方博客与通义千问平台发布记录显示,这是一款面向"最优性价比"定位的模型,在编程辅助、智能体协作、图文理解等场景表现突出,让旗舰大模型竞争再度聚焦到"架构创新+极致算力成本"上。

MoE架构与激活参数

Qwen3.8-Flash采用MoE(混合专家)架构:总参数125B,每个token仅激活6B参数,另含51B N-gram embeddings用于低成本扩展词汇/语言覆盖。这种"大总参、小激活"的设计让模型兼具较强能力与较低推理成本,是当前MOE模型控制每token算力开销的主流思路。

百万级上下文与多模态

该模型原生支持262,144(262K)token上下文窗口,并可通过配置扩展至100万token,官方称其在长文档、多轮智能体协作的复杂任务上具备优势;同时支持图文等多模态理解。对RAG、长会话类Agent(智能体)应用而言,这降低了长上下文工程化的门槛。

价格与部署

API定价为输入1元/百万token(约0.16美元)、输出3元/百万token(约0.47美元),可通过通义千问/DashScope及阿里云百炼等渠道访问。同期8月中旬Gemini 3.7 Flash、DeepSeek-V4-Pro等新品密集发布,各厂商在本轮MOE模型的"性能-价格比"上展开贴身竞争,值得模型选型团队保持跟踪。

觉得有帮助?

联系我们,获取更多技术解决方案

Free Consultation