DeepSeek V4.1 Flash 全面解读:非对称编解码架构、原生多模态,与降价背后的新老争议
2026 年 9 月 10 日,DeepSeek 结束为期两天的内部测试,正式发布 DeepSeek V4.1 Flash。新模型换上了一套此前从未在开源大模型里见过的"非对称编解码"架构,跑分数据相当亮眼,价格也进一步下调——但在缺少完整技术报告的情况下匆忙上线,加上 V4 Flash 系列此前积累的"刷分"骂名,也让这次发布在社区里吵得不可开交。本文尽量把优点和争议都摆出来,你自己判断。

一、发布背景:内测两天,社区已经吵起来了
9 月 8 日,一个名为
deepseek-v4.1-flash-expires-on-0910 的临时模型 ID 悄悄出现在 DeepSeek 的 API 列表里——base_url 没变,但每账号并发上限被限制到 20,计费方式和当时的 deepseek-v4-flash 完全一致。眼尖的开发者很快在 V2EX 上开了帖子讨论这次"神秘内测"(V2EX 讨论帖),两天后,也就是今天,DeepSeek 官方正式发布了这个模型的定名版本:DeepSeek V4.1 Flash。巧合的是,就在发布前一天,多家媒体报道 DeepSeek 已聘请中信证券,为在上交所科创板上市做准备;几乎同一时间,DeepSeek 还公开了一波总计 150 人的工程师招聘(服务端与 Agent 弹性计算方向为主,要求 2–10 年经验)。从"实验室"到"企业级基础设施"的转型信号,和 V4.1 Flash 的发布挤在了同一周——这也是为什么不少评论把这次更新和公司战略变化联系在一起讨论,而不只是单纯看模型参数。
二、核心突破:非对称 Causal-Encoder-Decoder 架构
V4.1 Flash 最大的变化不是参数量堆叠,而是架构本身换了代。据介绍,模型总参数规模约 552B,采用一种被称为 Causal-Encoder-Decoder 的新架构:40 层 Transformer 被拆成 20 层编码器 + 20 层解码器,输入侧只激活约 8B 参数,输出侧激活约 16B 参数——输入和输出用的是两套不对称的计算规模,这在此前的 MoE 大模型里比较少见。
配合这套新架构,DeepSeek 同时引入了 SWA Bounded Replay(不再需要把注意力状态持久化写入 SSD)和 Compressed Sparse Attention 2(CSA2),后者结合静态注意力模式与 FP4 KV 缓存格式,把全局 KV 缓存压到约 890 字节/token,大约是上一代 Flash 的四分之一;官方口径是 HBM 占用降到原来的 1/4,SSD 占用降到 1/8,相比第一代模型 KV 缓存总量缩小了 437 倍。每个 MoE 层配置 1 个共享专家 + 384 个路由专家,再叠加条件记忆和推测解码,这些改动共同指向一个目标:同等甚至更强的能力,用更少的显存和更低的延迟跑出来。
另一个容易被忽略但影响很大的变化是训练方式:V4.1 Flash 是在 45 万亿 token 的多模态语料上从零训练的,图像能力从预训练第一天就原生参与,而不是像上一代 V4 Flash Vision-Exp 那样,在纯文本模型基础上"外挂"一个视觉编码器和对齐模块。稀疏注意力训练从 64K 长度开始,到 34T token 阶段扩展到 100 万 token 上下文;后训练流程包含 SFT、RL 以及 on-policy distillation,推理强度可在 1–100 之间连续调节(部分平台也直接提供 "high" / "xhigh" 挡位)。
三、规格与跑分:数字说话
把 V4.1 Flash 和上一代 V4 Flash 0731、目前的旗舰 V4 Pro 0813 放在一起看会更直观:
项目 | DeepSeek V4.1 Flash | DeepSeek V4 Flash 0731 | DeepSeek V4 Pro 0813 |
架构 | Causal-Encoder-Decoder(新) | MoE + 混合注意力 | MoE + 混合注意力 |
总参数量 | 552B | 284B | 1.6T |
激活参数 | 输入 8B / 输出 16B(非对称) | 13B | 49B |
上下文窗口 | 1M tokens | 1M tokens | 1M tokens |
最大输出 | 384K tokens | 384K tokens | 384K tokens |
原生多模态 | 是(训练阶段原生融合) | 否(外挂视觉编码器) | 否 |
KV 缓存占用 | 约为上一代 1/4(HBM)、1/8(SSD) | 基准 | — |
调用模型名 | deepseek-flash | deepseek-v4-flash(已下线,自动路由) | deepseek-v4-pro(计划下线,路由至 V4.1 Flash) |
跑分方面,DeepSeek 公布的基础版对比数据显示,V4.1 Flash Base 已经在多个基准上超过参数量大得多的 V4 Pro Base:MMLU-Pro 74.1(对比 73.5)、HumanEval 79.4(对比 76.8)、GSM8K 93.0(对比 92.6)。在开满推理强度的指令模型对比中,V4.1 Flash 的 Terminal-Bench 2.1 得分为 90.6(V4 Pro 为 87.9),CyberGym 得分 88.1(V4 Pro 为 83.3)。独立评测机构 vals.ai 的记录显示,V4.1 Flash 于 2026 年 9 月 10 日上线,支持 1M 上下文 / 384K 最大输出,综合准确率约 57.86%(±1.16)。
其他公开跑分还包括:GPQA Diamond 90.9、Codeforces 评分 3,471、MathArena Apex 65.6;多模态方面 MMMU-Pro 56.5、CVBench 77.9、DocVQA 95.6,配合工具调用的 Chartography 78.9、BabyVision 89.6。需要说明的是,V4.1 Flash 在 Humanity's Last Exam、SimpleQA 等强调知识广度的基准上仍落后于第一梯队模型,在 Terminal-Bench 3.0/4.0 这类更新的高难度基准上也不及 Opus 5.0——它的强项更偏向工程、代码与结构化任务,不是全面登顶。
下面这个交互面板把规格、跑分和一个基于官方降价比例的省钱估算工具打包在一起,可以自己戳一戳:
四、价格调整:降价了,但降价姿势引发疑问
新定价从北京时间 9 月 10 日 12:00 起生效,继续沿用"峰时 / 谷时"两档计费,谷时价格仍为峰时的 50%。官方编辑注明确给出了相对上一代 V4 Flash(同一时间段对比)的降价比例:缓存命中输入便宜 60%,缓存未命中输入便宜约 33.3%,输出便宜约 11.1%。官方给出的一个具体算例是:固定用量 100 万缓存命中输入 + 10 万缓存未命中输入 + 1 万输出 token,谷时单次任务成本从 0.245 元降到 0.16 元,降幅约 34.7%。
不过截至本文撰写时,DeepSeek 官方尚未在博客正文里贴出完整的新版每百万 token 单价表(图表形式,未能完整抓取),第三方转售平台给出的参考价格(如 aihubmix 报的约 0.155 美元/M 输入、0.62 美元/M 输出)与上述比例换算结果存在一定差距,估计包含了转售加成,不能直接当作官方价格。所以本文没有在交互面板里编造一份"看起来很精确"的绝对单价表,而是做了一个基于官方公布比例的迁移省钱估算器——填入你现在按 V4 Flash 计费的月度支出结构,就能看到切换到 V4.1 Flash 后大致能省多少,更保守也更接近真实情况。
模型命名上,DeepSeek 也做了收敛:新的规范模型 ID 是
deepseek-flash,旧的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 仍可调用,但会自动路由到 V4.1 Flash,按 Flash 价格计费。北京时间 9 月 14 日 12:00 后,在 V4.1 Pro 上线之前,所有 deepseek-v4-pro 请求也会路由到 V4.1 Flash,按 V4.1 Flash 价格计费——DeepSeek 官方的说法是,V4.1 Flash 已经"在性能、成本、速度和端到端延迟上全面超越 V4 Pro"。这个说法本身也是本文后面争议部分要讨论的焦点之一。五、生态整合:腾讯、OpenCode 与开放权重
腾讯的 WorkBuddy、CodeBuddy 已经作为官方合作伙伴完成了对 V4.1 Flash 的适配,OpenCode 同样是首批集成方。模型权重继续保持开放,可以在 Hugging Face 上下载,技术报告 PDF 也已经放出——不过要注意,这份技术报告是随开放权重一起补发的,并不是内测阶段就有的东西,这一点在下一节的争议里会再提到。
六、优点总结:为什么有人真心叫好
综合官方数据和早期体验者的反馈,V4.1 Flash 目前被认可的几个点是:
- 速度肉眼可见地快。 内测用户反馈:简单问题"你好"平均思考 0.3 秒即可给出回复,端到端往返约 0.8 秒;长文本重活情况下生成速率可达 420 tokens/秒,端到端吞吐约 409.5 tokens/秒。和上一代 V4 Flash Vision-Exp 同题对比:4.9 万 token 长文检索快 5.2 倍,SVG 代码生成快 6.0 倍,Manacher 回文算法题快 4.6 倍,大型 SQL 查询生成与优化快 5.0 倍,asyncio 异步重构任务快 3.9 倍。
- 原生多模态更靠谱。 有博主用一张西装照片测试图像理解能力,V4.1 Flash 正确识别出了条纹西装的细节,没有像上一代 Vision-Exp 版本那样出现幻觉——这与其"从预训练第一天起就原生融合图像"的架构选择直接相关。
- 同等甚至更小激活规模下跑分更高。 用远小于 V4 Pro 的激活参数量,在多个基础和指令跑分上反超,如果这个结果在更大范围的真实使用中站得住,对推理成本敏感的场景(比如高并发 Agent 任务)会很有吸引力。
- 确实更便宜了。 即便官方还没有贴出完整单价表,缓存命中输入降价 60%、输出降价 11.1% 这两个比例本身是官方明确承诺的,对已经在用 DeepSeek 系列模型的团队来说,这是一个可以直接兑现的好处。
七、争议与不满:不只是"信不信官方跑分"
这次发布的争议其实分成两条完全不同的线,混在一起讨论容易失真,这里尽量分开说。
7.1 关于 V4.1 Flash 本身:发布方式引发的新质疑
- 内测阶段没有技术报告,也没有性能参数表。 有媒体报道明确指出,两天内测期间 DeepSeek 只放出了模型本身,没有同步公开技术报告或详细跑分表——这些内容是发布当天甚至之后才补上的。对于一个换了核心架构的模型,"先上线、后补资料"的节奏让部分观察者感到意外。
- "成本更低,然后价格不变?" 内测期间,
deepseek-v4.1-flash-expires-on-0910的计费方式被设定为和旧版deepseek-v4-flash完全一致,V2EX 网友对此提出了直接的疑问(原帖链接):如果新架构真的把 KV 缓存开销降到了四分之一,为什么内测阶段价格没有同步下调?这种"先用旧价格测试,正式版再降价"的做法,也让一部分人怀疑官方对外宣传的"效率提升"数字有多少是营销话术。
- 短短 40 天从 V4 到 V4.1,架构却整体换代,命名是否"配得上"这种跨度也有争议。 V4 正式版发布于今年 4 月末,V4.1 Flash 距离上一次"正式版"级别更新时间不长,但架构变化幅度不小,有评论调侃这种跨度"感觉应该叫 V5 Flash",而不是一个小版本号更新——这也从侧面反映出,社区对 DeepSeek 版本号语义的信任还没有完全建立起来。
7.2 关于 V4 Flash 系列:一笔还没还清的老账
V4.1 Flash 继承的是 V4 Flash 这条产品线的名字和口碑,而上一代 V4-Flash-0731 留下的负面评价相当集中,这也是很多人一看到"又是 Flash"就本能怀疑的原因:
- Reddit r/LocalLLaMA 上一篇标题直接叫《Unpopular opinion, Deepseek V4 Flash is not Good》的帖子认为它"刷分刷到了离谱的程度",实际编程能力"完全够不上 Opus 4.8,甚至不如 4.6","GPT 5.5 在纯编程任务上明显更好用"(帖子链接)。
- 另一篇帖子《Is anyone else finding DeepSeek-V4-Flash unreliable for non-coding tasks?》指出,尽管跑分很高,模型在处理非编程类任务时经常抓不住细节、理解偏差明显(帖子链接)。
- 《Deepseek v4 flash 0731 still not holding up》一帖反映,无论用中文还是英文提示,模型都容易无视用户自定义的规则、提示词和技能设定(帖子链接)。
- r/SillyTavernAI 的《Anyone disappointed on deepseek v4?》里,多位用户认为 Flash 版本"明显更笨,容易跑偏",和 Pro 版本的差距比参数比例暗示的更大(帖子链接)。
- 技术层面也有实打实的 bug 报告:vLLM 项目上有关于 DSML 工具调用包装格式错乱导致输出损坏的问题(issue #51914)、温度为 0 时输出仍随并发量变化而非确定性输出的问题(issue #53257)、在部分 SM120 硬件上输出退化为重复固定 token 的问题(issue #52938);OpenCode 项目也有用户报告 V4 Flash 会在任务未完成时提前终止(issue #39219,标题直接是"Deepseek V4 Flash fails on all tasks")。
需要强调的是:以上问题绝大部分是社区针对上一代 V4-Flash-0731 的反馈,截至发稿,尚没有足够规模的公开测试能证明 V4.1 Flash 是否延续、缓解或者放大了这些问题——毕竟它用的是全新架构,理论上完全可能表现不同。但正因为"Flash"这个名字自带了一段不太好的历史记录,不少人对官方这次"全面超越 V4 Pro"的宣传,本能地多留了一分怀疑,这也是本文把新老问题分开说的原因。
八、写在最后
抛开营销话术,V4.1 Flash 在架构设计上确实展示了一些新东西:非对称输入输出激活、原生多模态从零训练、KV 缓存压缩到极致,这些都不是简单堆参数能做到的。如果官方公布的跑分和早期体验者反馈的速度提升能在更广泛的场景里稳定复现,这会是一次值得认真对待的效率突破。
但两天内测、缺技术报告先上线、内测价格与旧版本一致这些细节,叠加 V4 Flash 系列本身还没洗清的"刷分"争议,也让人有理由在下结论前多等一等——等技术报告被更多人读完,等更大规模、更中立的第三方评测结果出来,等真实生产环境里跑上几周。毕竟,对于一个自称"全面超越"上一代旗舰的模型,"让数据说话"的最后一步,恰恰应该是最经不起省略的那一步。
你已经在生产环境里试过 V4.1 Flash 了吗?速度和多模态表现和官方宣传的一致吗?评论区聊聊你的真实体验。
参考资料
作者:Stav
声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。
Previous
模板说明
Next
GPT‑6 Astra 全面解读:关键规格、能力边界与三个 HTML 实战样本