深度求索 发布 DeepSeek V4.1 Flash 模型。这是其全新模型结构系列中尺寸最小的模型,具备原生多模态视觉理解能力。新模型结构的设计初衷是:能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型。
输入激活仅 8B,HBM 需求降至 1/4
DeepSeek V4.1 Flash 为 552B 参数的 MoE 模型,采用全新的 Causal-Encoder-Decoder 结构,输入和输出不对称——输入激活只有 8B,输出激活 16B,成本显著低于已知的同尺寸模型。新模型还采用了新的预训练方式,并经过更大规模的强化学习后训练,在基准测试中成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。
此外,新一代模型大幅减少了 KV Cache 缓存大小,与上一代相比对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8;相对于初代模型,KV Cache 仅为原来的 1/437。在 Agent 使用场景中缓存命中费用往往占比较高,对 KV Cache 的压缩大幅降低了 Agent 类任务的使用成本。

已同步上线 API,V4 Pro 将于 9 月 14 日路由切换
DeepSeek V4.1 Flash 已同步上线 DeepSeek API,原生支持多模态,将模型名称更改为 deepseek-flash 即可调用。旧版本模型 V4 Flash 与 V4 Flash Vision Exp 现已下线,出于兼容考虑,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 将被暂时路由到 V4.1 Flash。
经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro,官方因此计划有序下线 V4 Pro:北京时间 2026 年 9 月 14 日 12:00 之后,至未来 V4.1 Pro 上线之前,用户访问 deepseek-v4-pro 的请求将全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。

腾讯(WorkBuddy、CodeBuddy)和 OpenCode 作为官方合作伙伴,现已全量接入 DeepSeek V4.1 Flash。得益于架构创新,官方相应下调了 V4.1 Flash 的定价,同时仍采用峰谷定价——闲时价格为高峰时段价格的一半,新价格于 2026 年 9 月 10 日 12:00 起生效。模型权重与技术报告已同步在 Hugging Face 开放。