开发14 分钟

DeepSeek V4-Flash 震动市场的七个点:一份可核对的成本账

2026 年 7 月 31 日 V4-Flash 正式版上线,四天登顶 OpenRouter 周调用量榜,一周吃掉 7.22 万亿 token。真正值得记住的不是「又便宜了」,而是它同时打掉了三个行业默认前提:参数越多越聪明、贵模型贵得有道理、后训练必须靠混合强化学习。这篇按七个点逐层拆,每个数字都标明口径,最后给一人公司一份可执行的模型路由建议。

一句话事实:发生了什么

2026 年 7 月 31 日,DeepSeek 发布 V4-Flash 正式版:2840 亿总参数、130 亿激活的 MoE 模型,百万级上下文,MIT 开源,预训练超过 32 万亿 token。

上线四天后它登上 OpenRouter 周调用量第一,7 月 27 日至 8 月 2 日一周处理约 7.22 万亿 token。同期 OpenAI 的 GPT-5.6 Luna 约 2.99 万亿排第五,此前风头很盛的 Kimi K3 跌出前十,落到第 12 名。

这个结果值得注意的地方在于口径:OpenRouter 统计的是开发者真实付费调用量,不是下载量、不是榜单跑分、也不是社交媒体声量。而且流量里接近一半来自欧美开发者,不是国内自循环。它是目前少数几个不太好刷的指标之一。

点一:便宜 100 倍,说的不是单价

V4-Flash 的官方单价是每百万 token 输入约 0.14 美元、输出约 0.28 美元,放在 2026 年的价格表里算便宜,但不算离谱。真正拉开差距的是第三方测评用的另一个口径:单任务总成本

口径V4-FlashClaude Fable 5倍数
完成同一件任务的总花费约 3 美分约 3.15 美元约 105 倍
智力指数差距基准分低 9 分基准分高 9 分9 分

两边差 105 倍的钱,换回来 9 分的能力差。这个比例是整件事的核心,不是「便宜」本身。

更关键的是缓存命中价:约 0.003 美元每百万 token,比未命中的输入价低 98%(官方口径是 0.02 元人民币每百万 token,从首发价的十分之一再降下来的)。Agent 干活的特征就是反复重读同一段历史上下文,这笔隐性开销在别处是主要成本项,在这里直接被抹平。

有开发者实测:跑一整天高难度任务花 0.31 美元,之前用同类模型要 35 美元。注意这里要留一句口径提醒,输出价格分平峰与高峰两档(高峰时段输出翻倍),做成本测算时不要只按平时价推全天。

点二:130 亿激活打赢了自家 490 亿

过去三年行业的默认认知是参数越多越聪明。V4-Flash 用 130 亿激活参数,在全部 9 项 Agent 基准测试里打赢了自家 490 亿激活的 V4-Pro 预览版。

基准V4-FlashV4-Pro 预览版
Terminal Bench82.772.1
DeepSWE(真实软件工程修复)54.412.8

DeepSWE 那一栏的差距不是渐进式改良能解释的。而且模型结构完全没改,改的只有后训练方法。同一具身体换了套教学法,成绩从腰部跳到顶尖。

对采购方来说,这条比价格更有杀伤力:它意味着「这个模型参数大所以贵得有道理」这句话不再自动成立,贵和强之间的因果链被切断了一次。

点三:秘密武器是换了一套教学法 OPD

此前行业后训练主流是混合强化学习:把数学、代码、Agent 等目标混在一起训,经常出现「数学练上去了代码掉下来」的跷跷板效应。

DeepSeek 直接把混合 RL 阶段整个删掉,换成 OPD(On-Policy Distillation,同策略蒸馏),分两步:

  1. 先训十几个偏科专家。 数学、代码、Agent、指令遵循各一个,都从同一个预训练底座出发,各自做领域 SFT 再上领域定制奖励的强化学习。每个专家在自己领域里练到极致,互不干扰,跷跷板问题从源头消失。
  2. 再让统一模型自己写答案。 学生模型生成自己的输出,由当前任务最相关的那个专家逐 token 打分纠偏。学的是「自己容易犯的错」,而不是抄老师的完美答案。

这个区别很重要。传统蒸馏是让学生模仿老师的正确轨迹,学生在自己真实会走偏的地方反而拿不到监督信号。同策略蒸馏把纠错点对准了学生自己的分布,样本效率高得多。

同期还做了一批底层优化:过滤预训练数据里的 AI 生成垃圾、用混合注意力把百万 token 推理算力降到上一代的 27%、KV 缓存降到 10%,再叠加 Muon 优化器、F4 量化与投机解码。在美国限制先进芯片的背景下,这些是从现有芯片里多榨算力的工程动作。想看这一层在整个技术栈里的位置,可以对照AI 技术栈演进那份梳理。

点四:不抢用户,直接嵌进对手的生态

V4-Flash 原生支持 OpenAI 的 Responses API,并专门适配了 OpenAI 的编程 Agent 产品 Codex。它同时还保留着 2025 年就在跑的 Anthropic 格式接口。

实际效果是:开发者不用改工具、不用改代码,把调用的模型名换掉、base URL 指过去就行,账单直接降九成。不支持的字段(store、previous_response_id、conversation、background 等)服务端静默忽略,不报错,所以现有客户端基本能直接连上。

这是一步很克制的棋。它没有试图让开发者放弃 Codex 或 Claude Code 转投自家客户端,而是把迁移成本压到接近零,让人在原有工作流里顺手换掉底层模型。争夺的是调用量,不是用户心智。

DeepSeek 还明确把 Flash 定位成 Agent 场景的默认选项,而不是 Pro 的廉价备胎。这个定位配合零成本迁移,才构成完整的打法。

点五:这不是情绪,是真金白银的账

模型发布后的声量很容易造,调用量不容易。OpenRouter 的数据是开发者掏钱投的票,公开可查,这是判断这件事真假的最好抓手。

反例更能说明问题:Kimi K3 的智力指数比 V4-Flash 高 7 分,但输出价是后者的 53 倍,一周内从榜单前列跌到第 12 名。

能力强的输了给算得过账的。这在 2026 年之前不太成立,那时候大家为了效果愿意付溢价。转折点在于 Agent 工作流普及:Agent 一次任务动辄几十上百次调用,单价乘以调用次数之后,53 倍的价差不再是可以忽略的尾数,而是决定项目能不能跑正的分母。谁在为这些调用买单、怎么记账,是另一个话题,AI Agent 金融基础设施那篇专门讲这层。

点六:三家对手挨了三种不同的打

对手应对方式现状
OpenAI提前一天把 GPT-5.6 Luna 降价 80%(输入 1 美元降到 0.20 美元,输出 6 美元降到 1.20 美元)降完仍比 V4-Flash 贵约 3 倍,属于被动防守
Anthropic站着不降价,靠企业客户撑住(约 80% 收入来自企业,财富 10 强里 8 家在用)中间层客户开始流失,例如 Lindy AI 转投 DeepSeek,成本降约 90%
月之暗面无法降价K3 技术更强,但 3 万亿参数的推理成本结构决定了它降不动

三家的处境不一样。OpenAI 降得动价,但降完还是贵,只能继续降;Anthropic 选择不打价格战,用企业合同和能力密度维持利润率,代价是把中间层市场让出去;月之暗面最尴尬,一边估值三个月涨近 3 倍到 500 亿美元,一边调用量掉出前十,单位经济账算不过来。

这里有个容易被忽略的判断:Anthropic 不降价未必是失误。它没有降 API 牌价,而是用同样的价格投放更强的模型,等于降的是「每单位能力的价格」。这条路只在客户愿意为可靠性付钱时成立,而企业客户恰好是这类客户。

点七:最震撼的地方,也是最脆弱的地方

把反面一起摆出来,这份判断才完整。

一、开源是双刃剑。 MIT 协议意味着企业可以自己部署,完全不用付 DeepSeek 钱。调用量第一不等于收入第一,这两件事之间没有必然联系。

二、成本利润率数据是旧的。 之前广为流传的 545% 成本利润率是 2025 年 H800 集群时期的数据,V4 已经迁到华为昇腾,新的成本结构没有公开。拿老数字推新账是错的。

三、9 项 Agent 基准都是自家评测。 目前没有第三方独立复现。基准分是厂商自测这件事本身不代表造假,但在没有复现之前,它的证据等级低于 OpenRouter 那类真实调用数据。

四、没有原生多模态。 纯文本模型,涉及图像、音频的场景要另找方案或做拼装。

五、输出更长会吃掉部分价格优势。 复杂任务上它的输出 token 数偏多,按输出计费的场景里,单价优势会被 token 量部分抵消。做成本对比时应该比「完成同一任务的总花费」,而不是比每百万 token 单价。

另外,更强的 V4-Pro 正式版已经跳票,Responses API 目前也只支持 Flash,Pro 的支持计划在 8 月初。整个叙事目前是由 Flash 一个型号单独撑着的。

一个人干活的话,怎么用这件事

如果你是一个人在做产品,下面四条比「哪个模型最强」更值得先想清楚。

  1. 先把任务分层,再选模型。 不要全站押一个模型。批量、重复、容错高的活(分类、抽取、初稿、日志摘要)走 V4-Flash 这类便宜模型;需要判断力、直面用户、出错代价高的活留给贵模型。绝大多数产品里前者的调用次数是后者的几十倍,省的钱全在前者。
  2. 把缓存命中率当成一个正经指标。 98% 的缓存折扣只有在你稳定复用同一段前缀时才拿得到。系统提示词、工具定义、长文档要放在前缀固定的位置,别每次拼装顺序都变。这件事的收益经常比换模型还大。
  3. 迁移成本已经接近零,所以先测,别先做决策。 接口兼容意味着你可以花一小时接上去,用自己的真实任务集跑一轮对比,拿自己的数据说话。在有实测结果之前,任何基于榜单的选型都是猜。
  4. 别把一个还没被第三方复现的优势写进商业模式。 可以用它省钱,不要用它当护城河。你的成本优势对手明天也能有,因为这个模型是开源的,谁都能用。

判断一个方向值不值得投入,可以再用项目可行性评估那套红线加六维打分过一遍,尤其是「验证成本」这一维,模型降价直接改变的正是这一项。

常见问题

V4-Flash 便宜 100 倍,这个说法准确吗?

要看口径。按每百万 token 单价算不到 100 倍,它的官方价是输入约 0.14 美元、输出约 0.28 美元。100 倍这个数字来自第三方测评的单任务总成本口径:完成同一件任务,V4-Flash 约 3 美分,Claude Fable 5 约 3.15 美元,约 105 倍,同时两者智力指数差 9 分。引用时应当说明用的是总成本口径,不是单价口径。

OPD 和普通的模型蒸馏有什么区别?

普通蒸馏让学生模仿老师生成的正确轨迹,学生在自己真实会走偏的地方拿不到监督。OPD(同策略蒸馏)让学生先生成自己的输出,再由对应领域的专家模型逐 token 打分纠偏,学的是学生自己容易犯的错。DeepSeek 用它整个替换掉了以往的混合强化学习阶段,先训十几个偏科专家,再把它们的能力合并进一个统一模型,绕开了多目标混训的跷跷板效应。

130 亿激活参数打赢 490 亿,是不是意味着大模型路线错了?

不能这么推。这个结果证明的是后训练方法的杠杆比参数量大,而不是参数量无用。对比发生在 9 项 Agent 基准上,属于特定任务类型;对比对象是自家 V4-Pro 的预览版而非正式版;而且评测由 DeepSeek 自己完成,尚无第三方复现。合理的结论是「参数量不再自动等于能力」,不是「参数没用」。

接入 V4-Flash 需要改多少代码?

如果你在用 OpenAI Responses API、ChatCompletions 或 Anthropic 格式,基本只需要换 base URL 和模型名。它原生支持 Responses API 并适配了 Codex,不支持的字段(store、previous_response_id、conversation、background 等)服务端静默忽略而不报错,现有客户端一般能直接连上。真正需要投入的是用你自己的真实任务集跑一轮效果对比,而不是接口改造。

开源了,DeepSeek 靠什么赚钱?

这正是这件事最脆弱的一环。MIT 协议下企业可以完全自部署,一分钱不付给 DeepSeek,所以调用量第一不等于收入第一。此外之前流传的 545% 成本利润率是 2025 年 H800 集群时期的旧数据,V4 已迁至华为昇腾,新的成本结构没有公开。目前没有足够的公开信息支撑对其盈利能力的判断。

现在应该把所有调用都切到 V4-Flash 吗?

不建议。合理做法是按任务分层:批量、重复、容错高的任务走便宜模型,需要判断力和直面用户的任务保留贵模型。要注意它没有原生多模态,复杂任务的输出 token 偏长会吃掉部分价格优势,9 项基准也还没有第三方复现。另外 V4-Pro 正式版已跳票,整个叙事目前由 Flash 单个型号支撑,把关键路径全押在一个型号上风险偏高。