

DeepSeek V4 Flash 终于发布了。
但老实说,这次只砸起了一点水花。
它当然强。我也确实把它放进自己的真实工作流里,跑了资料梳理、长文处理、方案分析、结构化输出和一些局部代码任务。
我的结论是:能用,而且已经足够覆盖我日常工作里的大部分需求。
可如果你问我有没有被惊艳到?
没有。
如果 V4 Flash 早一点发布,它获得的关注可能会大得多。可它前面已经站着一个 K3,提前把大家对国产模型在复杂编程、长上下文和 Agent 任务上的期待拉高了。
这里需要强调一下,我并不是说 K3 是全球最强模型。
如果可以直接使用 OpenAI 或者 Anthropic 的高阶模型,复杂任务的能力上限依然是另外一回事。就连 Kimi 自己也承认,K3 的整体表现与最强的闭源模型仍然存在差距。
我说的是,如果前提被限定在国产模型里,K3 已经提前占据了复杂任务这一层。再回过头看 V4 Flash,就很难产生“国产模型又跨了一代”的冲击感。
更何况,严格来说,这也不是整个 V4 系列的全面更新。
这次上线的是 DeepSeek-V4-Flash-0731:Flash 正式版本进入 API 公测,V4 Pro 和 App、Web 端都没有同步更新。核心架构和规模也没有变化,主要提升来自重新后训练,重点增强了 Coding Agent、工具调用和自动化任务能力。
所以,只看模型能力,这次发布确实没有太多可以制造情绪的地方。
但是看完价格,我觉得这篇文章还是必须得写。
按照 DeepSeek 目前的常规 API 价格:
一百万未命中缓存的输入 Token,1 元;
一百万输出 Token,2 元;
如果命中缓存,一百万输入 Token 只要 2 分钱。
官方还预告后面会启用峰谷定价,高峰时段价格翻倍。可即使按翻倍后的价格计算,它依然便宜得离谱。
所以 V4 Flash 真正值得讨论的,不是它有没有重新成为最强国产模型。
而是当一个模型已经足够好用,价格又被压到这个位置之后,它会怎样改变我们使用 AI 的方式。
这次我实际用下来的感受很明确。
V4 Flash 已经不是那种“因为便宜,所以只能勉强凑合”的模型了。
在资料整理、内容改写、文档总结、结构提取、轻量分析和局部代码处理这些任务里,它给出的结果基本都能继续往下使用。
有些内容需要我再调整一下,有些任务需要补充要求,但整体上,它已经越过了我对日常模型的可用线。
这点非常重要。
因为大多数普通任务,并不要求模型一定拿到 100 分。
一份资料总结,只要没有漏掉关键信息,结构足够清楚,就可以继续使用;一段文案,只要方向正确,后面本来就需要人工修改;一段局部代码,只要边界明确、能够通过测试,也没必要每次都调用最贵的模型。
在这些任务上,一个模型从 90 分提高到 93 分,实际带来的价值可能没有想象中大。
但如果它的价格下降十几倍甚至几十倍,影响就完全不同了。

按照双方公布的国际 API 价格,V4 Flash 未命中缓存的输入是每百万 Token 0.14 美元,输出是 0.28 美元;K3 分别是 3 美元和 15 美元。
也就是说,K3 的输入价格大约是 V4 Flash 的 21 倍,输出价格大约是 54 倍。
当然,价格相差几十倍,不代表能力也相差几十倍。
但这正是 V4 Flash 最有产品价值的地方:当能力已经越过可用线,价格就开始决定这个模型到底只能偶尔使用,还是可以成为默认能力。
经常使用 OpenAI 或者 Anthropic 模型的人,看到现在的国产模型发布,很容易觉得:
也就那样吧。
这种感受并没有错。
如果只是一个人偶尔处理一项复杂任务,当然可以直接选择自己能用到的最强模型。一次调用贵几块钱还是便宜几块钱,通常不会成为决定性因素。
但公司选择模型时,算的不是同一笔账。
你真的进入企业的 AI 项目里,会发现很多公司依然在使用 DeepSeek、豆包或者通义作为底层模型。
难道这些公司的产品经理和技术负责人不知道 GPT、Claude 更强吗?
当然知道。
但个人用户选择的,往往是“哪一个模型能给我最好的这一次回答”;公司采购的,却是一种能够稳定供应、持续接入,并且可以大规模调用的生产能力。
去年下半年,中国企业日均大模型使用量已经达到 37 万亿 Token,比上半年增长 263%。相关统计里,通义、豆包和 DeepSeek 占据了企业 Token 消耗量的前三名。
到了这个规模,模型的单价就不再只是财务报表上的一行数字,而会直接决定产品能不能成立。
一个普通用户发出一次请求,背后可能不是一次模型调用。
Agent 需要先理解任务,再检索资料、调用工具、生成内容、检查结果,失败以后还要重新规划。用户看起来只点了一次按钮,后台可能已经运行了十几次甚至几十次模型。
如果每一次都使用最贵的模型,很多功能不是利润低一点,而是从一开始就没有商业可行性。
除了价格,公司还要考虑数据合规、部署方式、供应稳定性、并发能力、接口兼容、现有系统的迁移成本,以及模型出现问题以后能不能快速处理。
所以企业并不是在单纯比较哪一个模型最聪明。
它真正寻找的是:
一个能力已经越过业务门槛,同时成本、风险和供应都可以控制的模型。

模型比较贵的时候,AI 往往会被设计成一个很显眼的功能。
用户需要主动点击;每天有调用次数限制;只有付费用户才能使用;一个任务尽量只调用一次模型。
因为每一次调用都在产生成本。
但当模型价格下降到 V4 Flash 这个位置,产品设计的逻辑会开始发生变化。
过去舍不得把整份文档交给模型,现在可以完整处理;过去只能生成一次,现在可以先生成,再检查,再修正;过去只能串行跑一个结果,现在可以并行生成几个候选,再从中选择;过去只能在用户点击时调用,现在可以让 AI 在后台持续完成分类、提取、整理和更新。
模型能力并没有突然发生质变。
但产品敢让它参与的环节变多了。
这也是我认为 V4 Flash 最值得关注的地方:
它没有明显改变“AI 能做什么”,却可能改变一个产品“敢让 AI 做多少次”。
很多 AI 产品过去的问题,并不是模型完全做不到,而是模型每做一次都太贵。
低价模型真正释放出来的,是调用密度。
当一次任务可以承担更多次调用,产品就有空间加入重试、检查、对比和失败升级,用工作流去弥补单次模型的不稳定。
这并不意味着调用三次便宜模型,就一定可以追平一次更强的模型。模型可能连续犯同一种错误,也可能根本意识不到自己错在哪里。
但至少,产品终于有了用冗余换可靠性的经济空间。
这才是“便宜”从采购优势变成产品能力的过程。
当然,便宜不等于性价比高。
如果一个模型调用一次只花几分钱,最后却需要人工花半小时重新检查和修改,那它仍然很贵。
反过来,一个更强的模型虽然单次调用价格高很多,但一次就完成了高风险任务,减少了返工和错误,它反而可能更省钱。
所以公司真正应该计算的,不是 Token 单价,而是:
单次有效交付成本
=模型调用成本+重试成本+结果验证成本+升级模型成本+人工返工成本+失败风险
这个公式也能解释,为什么我认为 V4 Flash 可以覆盖日常工作里的 90%,却不建议让它单独承担大型项目开发。
这里的 90%,不是说它在所有任务上都有 90% 的成功率,更不是说所有人的 90% 任务都可以交给它。
它指的是我自己的任务分布。
我平时大量工作都集中在资料梳理、内容处理、信息提取、方案分析、结构调整、简单脚本和局部代码修改上。这些任务边界相对清楚,结果可以检查,失败以后也容易重试。
在这些地方,V4 Flash 已经足够好,而且便宜得几乎不需要犹豫。
但大型项目开发不是这样。
大型项目真正困难的地方,从来不只是“能不能写出某一段代码”。
它需要模型理解整个代码库,记住已有约束,连续执行几十步任务,在工具调用失败以后恢复状态,修改一个模块时不破坏另一个模块,还要在发现方向错误时及时回退。
这类任务执行时间长、上下文复杂,很多错误又不能立刻被发现。
前面九步都做对了,第十步改坏了核心模块,前面省下来的成本就没有意义了。
所以我的判断不是 V4 Flash 不能参与大型项目。
它当然可以负责其中明确、局部、能够测试的执行任务,但我不会让它单独承担整个项目的规划、推进和最终交付。
因为到了这里,真正昂贵的已经不是 Token,而是失败。
我给到的需求:


DeepSeek V4 Flash 的回答

Claude opus5 的回答

他们俩本质上在回答骨架上就有差异

先把前提说清楚。
如果 OpenAI 或者 Anthropic 的模型可以正常使用,而且任务失败的成本很高,我依然会优先考虑当时能力更强的模型。
K3 不是全球模型能力的天花板。
但如果限定在国产模型里,目前我最愿意长期使用的组合,确实是 K3 加上 DeepSeek V4 Flash。
V4 Flash 负责高频、明确、可以验证的任务。
比如资料处理、内容生成、格式转换、轻量分析、局部代码修改,以及大量标准化的后台任务。
K3 负责上下文更长、任务更加模糊、需要多轮工具调用,或者失败以后返工成本很高的复杂任务。它原生支持视觉输入和百万上下文,也更适合作为国产模型组合里的复杂任务层。
这套组合并不是简单地让 K3 负责思考、V4 Flash 负责干活。
如果每一个任务都先交给 K3 规划,不仅会把成本重新拉高,两个模型之间的信息交接也可能产生损耗。
更合理的方式,是让 V4 Flash 成为默认执行层。
任务边界清楚、结果能够通过规则或者测试验证,就直接由它完成;当上下文持续变长、连续重试仍然失败、任务开始涉及多模态,或者错误会产生较大损失时,再升级到 K3。
关键任务无论交给哪一个模型,最后都要经过程序测试、人工检查或者业务规则验收。
这样一来,K3 提供的是国产模型组合里的复杂任务上限,V4 Flash 提供的是规模和吞吐量。
一个保证难题有人处理,一个保证日常任务能够低成本地一直运行。

以前做 AI 产品,大家最常问的问题是:
到底应该接哪一个模型?
但模型价格和能力逐渐分层以后,这个问题已经不够用了。
真正需要解决的是,哪些任务默认进入便宜模型,出现什么信号以后升级,哪些结果可以由程序自动验证,哪些任务必须人工检查,以及整个系统每完成一次有效任务到底花了多少钱。
这时候,模型选型就不再是一次性的采购决策,而变成了一套持续运行的任务路由。
对于 AI 产品经理来说,最有价值的工作也不再是追着每次发布会更新一张模型排行榜。
更实际的方法,是从真实业务里抽出几十个高频任务,让不同模型完成,然后记录结果是否可用、重试了几次、人工修改了多久、最终花了多少钱。
模型排行榜告诉你它可能很强。
真实业务评测集才能告诉你,它放进自己的产品以后,到底省不省钱。
而且这套评测不能只运行一次。
模型版本会更新,价格会变化,产品工作流也会变化。今天适合进入 V4 Flash 的任务,可能下一个版本直接完成率大幅提升;今天必须交给 K3 的任务,过一段时间也可能被下放到更便宜的模型。
产品经理真正要运营的,不是哪一个模型,而是一整套任务流量。
每一次选择模型时,最终都应该回到几个很朴素的问题:
它的质量有没有越过业务验收线?结果能不能验证?失败以后损失有多大?把重试、人工和风险全部算进去以后,一次有效交付到底多少钱?
回答完这些问题,模型应该放在哪一层,通常也就清楚了。
所以,如果你问我 DeepSeek V4 Flash 这次发布惊不惊艳?
确实没有。
它没有制造第二次 DeepSeek 时刻,也没有重新定义国产模型的能力上限。前面已经有 K3 抬高了大家的预期,再加上这次只更新了 Flash API,发布声量小是很正常的事情。
但发布声量和产品价值,本来就不是同一件事。
有些模型靠更高的能力上限告诉我们,AI 又能完成哪些过去做不到的任务。
V4 Flash 这次做的,是把一档已经够用的能力,压到了可以高频调用、反复验证,甚至长期隐藏在产品后台运行的价格。
它没有让我重新理解模型能够做到什么。
但它确实让我重新计算了一遍,哪些事情值得一直交给模型做。
如果可以使用全球模型,我依然会把最复杂、失败成本最高的任务交给真正处于能力前沿的模型。
如果只使用国产模型,我目前会选择 K3 承担复杂任务,DeepSeek V4 Flash 承担规模化执行。
不是因为这两个模型可以包打天下。
而是放在同一套工作流里,它们刚好解决了两个不同的问题:
一个负责把困难的事情做成,一个负责让大量已经能做的事情,便宜到可以一直做。
DeepSeek V4 Flash 没有惊艳我。
但这个价格,确实打穿了规模化使用 AI 的门槛。
复制本文链接 文章为作者独立观点不代表优设网立场,未经允许不得转载。









发评论!每天赢奖品
点击 登录 后,在评论区留言,系统会随机派送奖品
2012年成立至今,是国内备受欢迎的设计师平台,提供奖品赞助 联系我们
用户体验增长
已累计诞生 795 位幸运星
发表评论 为下方 1 条评论点赞,解锁好运彩蛋
↓ 下方为您推荐了一些精彩有趣的文章热评 ↓