2026年8月下旬,国产大模型的发布节奏再度加快。8月21日,DeepSeek面向API新增V4-Flash-Vision-Exp试验版本,次日即被多家外媒与第三方评测转载。这是DeepSeek-V4系列首个正式走入API的多模态实验型号,其"284B总参数/13B激活"的稀疏MoE规模与"图像按文本Token计价"的定价策略成为本周期最受关注的模型动态之一。

规格:稀疏MoE与1M上下文

据NVIDIA NGC目录与DeepSeek官方文档显示,DeepSeek-V4-Flash-Vision-Exp采用混合专家(MoE)架构,总参数量高达284B,单次推理激活约13B参数;上下文窗口支持1M Token,最大输出可达384K Token。与同系列DeepSeek-V4-Flash(同样284B总参/13B激活)相比,Vision版本的核心差异在于原生支持图像等多模态输入,文本推理与编码类Agent基准表现与V4-Flash接近。

多模态Agent能力:逼近头部闭源模型

在能力维度上,第三方评测显示,该模型在Agents' Last Exam等强调多模态与多步推理的Agent基准上表现接近Claude Opus-4.8等头部闭源模型。图像输入使得模型能够在真实业务场景中直接理解截图、图表、界面与纸质文档,这为"看图即理解上下文"的Agent类应用(如GUI自动化、文档审阅、多模态知识问答)提供了更低的接入门槛。

定价策略:图像不溢价

最值得注意的定价细节是:DeepSeek-V4-Flash-Vision对图像Token直接按文本Token价格计费,不收取任何多模态溢价。在业界普遍对视觉输入单独收费的背景下,这种"图文同价"的做法直接拉低了多模态应用的推理成本,被视为对Agent多模态落地的一记强刺激。与此同时,阿里云8月26日上线Qwen3.6-Max-Preview(当前仅开放纯文本能力),进一步印证了头部厂商在"更强模型+更低成本"路线上的持续投入。

企业接入建议

对于有截图识别、图表解析、文档审计等需求的团队,V4-Flash-Vision-Exp提供了一个"低成本多模态"的试验入口。建议先在成本敏感、数据结构化的中低频场景试点,并将其与纯文本模型的Agent流程做切换测试——在相同预算下,"图文同价"可能让原本因视觉费用过高而被搁置的自动化需求重新具备可行性。

觉得有帮助?

联系我们,获取更多技术解决方案

Free Consultation