DeepSeek V4.1 Flash发布:CED非对称架构加持,Agent性能超越V4 Pro,KV Cache压缩437倍

AI快讯 2026-09-12

9月10日,DeepSeek正式发布V4.1 Flash模型。作为全新CED(Causal-Encoder-Decoder)架构家族中体量最小的MoE模型,它在多项Agent基准测试中超越V4 Pro旗舰版本,同时带来原生多模态能力,借助KV Cache深度压缩与全新峰谷计费策略,大幅降低长会话、智能体任务的API使用成本。

一、全新CED非对称架构:输入输出差异化激活

V4.1 Flash整体骨干总参数达到552B,采用全新的Causal-Encoder-Decoder非对称架构。该架构为40层Transformer,前20层为因果编码器,后20层为解码器,实现输入输出阶段的差异化参数激活:处理输入时仅激活8B参数,生成输出时激活16B参数。

这种设计贴合AI Agent的真实工作模式:智能体运行过程需要读取海量历史对话、工具描述和项目源码,最终输出的指令和代码体量相对较小。编码器处理输入时激活参数更少,prefill计算复杂度从O(NL)降至约O(NL/2),接近减半。MoE层面,每层配置1个共享专家和384个路由专家,每token激活6个专家。

配合全新预训练方案与大规模强化学习后训练,官方测试显示,该模型在Terminal-Bench 2.1(90.6 vs 87.9)、Terminal-Bench 3.0(30.0 vs 11.8)、DeepSWE v1.1(74.2 vs 62.7)、AutomationBench(54.8 vs 43.2)等多项Agent评测中超过V4 Pro。不过需要说明,官方同时承认V4.1 Flash在知识容量维度上仍不及V4 Pro。

deepseek-v4-1-flash.png

二、原生多模态,百万上下文 + 384K输出上限

和上一代外挂视觉模块的实验版本不同,V4.1 Flash实现底层原生多模态视觉理解,无需额外外挂模块,直接支持图片、软件界面截图、图表、图文文档的解析识别。

API层面提供充足的能力配置:支持1M token上下文窗口,最高可输出384K token内容;同时兼容思考/非思考双模式、工具调用、结构化JSON输出、Responses API,接口格式兼容OpenAI、Anthropic。此外,模型支持reasoning_effort参数(整数1–100),可连续调节推理成本与准确率之间的平衡。

三、KV Cache极致压缩:从V1到V4.1缩小437倍

对于AI智能体来说,多轮连续运行会反复复用历史上下文,KV Cache缓存开销是成本大头。V4.1 Flash在缓存压缩上实现重大突破:全局KV Cache为890 bytes/token,对比上一代V4 Flash,HBM显存占用压缩至1/4,SSD存储需求降至1/8;对比初代V1模型,KV Cache整体规模累计缩小437倍。

这一压缩由三方面协同完成:

  • 架构层面:采用CSA2(Compressed Sparse Attention 2)机制,将全局KV缓存和Top-K索引跨层复用,每层只保留自己的查询向量和局部注意力缓存;

  • 缓存精度:训练阶段即采用FP4格式存储全局KV缓存,官方称性能损失几乎可以忽略;

  • 部署策略:新增SWA有界重放机制,SWA缓存不必再写入SSD,持久化缓存占用进一步压至V4 Flash的1/8。

效果上,上下文从4K拉长到1M,单token解码FLOPs只增加约四分之一,解码成本几乎不随上下文长度增长。

四、API调用规则、价格与路由变更

V4.1 Flash已正式上线DeepSeek API,开发者直接填写模型名称deepseek-flash即可完成调用。旧接口标识deepseek-v4-flashdeepseek-v4-flash-vision-exp暂时保留兼容,请求会自动路由至V4.1 Flash。腾讯WorkBuddy、CodeBuddy、OpenCode等产品已完成全量接入。

新计费规则于9月10日12:00正式生效,延续峰谷计价,闲时价格为高峰时段的一半。高峰时段为工作日9:00–12:00和14:00–18:00(北京时间),其余均为空闲时段(含周末)。具体价格如下:

计费项空闲时段高峰时段
输入(缓存命中)0.02元/百万token0.04元/百万token
输入(缓存未命中)1.0元/百万token2.0元/百万token
输出4.0元/百万token8.0元/百万token

一个重要的业务变动:自9月14日12:00起,至V4.1 Pro正式上线之前,所有指向deepseek-v4-pro的请求将全部路由转发至V4.1 Flash,并按V4.1 Flash价格计费。不过DeepSeek在9月11日又更新了说明,表示决定在9月14日之后继续提供V4 Pro模型的API调用服务,计费方式保持不变。这一动态调整值得开发者密切关注。

模型权重与51页完整技术报告已在Hugging Face以MIT许可证开源,可供开发者研究、私有化部署参考。

五、核心信息速览

  1. 552B MoE模型,CED非对称架构,40层=20层编码器+20层解码器,输入激活8B、输出激活16B,Agent基准性能超越V4 Pro(知识容量维度除外);

  2. 原生多模态,支持1M上下文、最高384K输出,兼容OpenAI/Anthropic接口格式;

  3. KV Cache大幅压缩至890 bytes/token,HBM降至前代1/4,SSD降至1/8,较V1缩小437倍;

  4. 调用名deepseek-flash,保留旧模型别名做兼容;V4 Pro路由规则存在动态调整,建议关注官方最新公告;

  5. 峰谷双档API定价,闲时半价;模型权重与技术报告在Hugging Face以MIT许可证公开。

六、常见问题FAQ

V4.1 Flash真的全面超越V4 Pro了吗?

在Agent基准测试的多个维度(Terminal-Bench、DeepSWE、AutomationBench等)上,V4.1 Flash表现优于V4 Pro。但官方同时承认其在知识容量上不及V4 Pro。选型时需根据具体任务类型判断。

KV Cache压缩437倍是怎么算的?

437倍是初代V1模型KV Cache规模与V4.1 Flash的比值。相对于上一代V4 Flash,V4.1 Flash的HBM需求降至1/4,SSD需求降至1/8。

现有调用deepseek-v4-flash的业务需要改代码吗?

不需要。旧模型标识符暂时保留兼容,请求会自动路由至V4.1 Flash。但建议尽早将调用名称更新为deepseek-flash

V4 Pro会被下线吗?

存在动态调整。9月10日官方计划9月14日12:00后将V4 Pro请求路由至V4.1 Flash;9月11日又更新说明,表示将继续提供V4 Pro的API服务,计费不变。建议以DeepSeek开放平台最新公告为准。

模型可以本地部署吗?

可以。模型权重已在Hugging Face以MIT许可证开源,技术报告同步公开。

参考来源:

免责声明:
本文信息整理自DeepSeek官方公告、开源仓库与公开媒体报道。模型能力、价格、路由规则和会员权益可能随时调整,请以DeepSeek开放平台官方页面为准。本文不构成购买建议或投资建议。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具集原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

相关文章

评论