先说结论:DeepSeek V4 Pro 0813 正式版发布了,但它并没有别人吹的那么强。

我知道这句话会得罪人。这两天朋友圈里全是"国产登顶"“吊打 GPT"“拳打 Claude"的标题,看得人热血沸腾。

但把独立评测的数据拉出来一对,你会发现——差距是真实存在的,而且不小。

不过别急着失望。这篇文章想说的是另一件事:DeepSeek 赢的根本不是你以为的那场仗。 它输掉了"绝对最强”,却在价格、开源、用户生态这几张牌桌上,把桌子都掀了。

下面慢慢讲。

一、先看硬数据:差距到底有多大?

OpenRouter 模型页内嵌了 Artificial Analysis 的三大基准指数(Intelligence 智能、Coding 编程、Agentic 智能体,满分 100),这是目前业界引用最多的独立评测之一。

直接看图:

Artificial Analysis 基准对比:国产旗舰 vs 世界顶级

把数字整理成表(均为各模型最高推理档位):

模型智能编程智能体价格 $/M(输入/输出)
Claude Opus 5637859$5 / $25
Grok 4.6617759$2 / $6
GPT-5.6 Sol617758$5 / $30
Kimi K3607654$3 / $15
Muse Spark 1.1537140$1.25 / $4.25
GLM-5.2536946$0.5 / $3.15
DeepSeek V4 Pro 0813455938$0.435 / $0.87

Qwen3.8 2.4T A95B 同期上线,三项基准暂时还没有数据。图中另有 KAT Coder Pro V2(编程 60)、Nex-N2-Pro(编程 59)两个编程专项模型,篇幅所限不列入。

看清楚这张表,三个事实:

1. DeepSeek V4 Pro 0813 三项基准,全面落后于第一梯队。 智能 45 对 63、编程 59 对 78、智能体 38 对 59——和 Claude Opus 5 的差距不是一星半点,是两位数。这就是"没别人吹的那么强"的数据来源,不是我说的,是评测说的。

2. 第一梯队目前还是美国三巨头。 Claude Opus 5 三项全冠,GPT-5.6 Sol 和 Grok 4.6 紧随其后。这个现实要认。

3. 但国产阵营里,已经有人摸到了天花板。 Kimi K3 三项全部全球前四:智能 60 对 63、编程 76 对 78、智能体 54 对 59,和榜首只差 2~5 分。这不是代差,是一两个版本的距离。上个月 Kimi K3 发布时央视罕见下场报道(当时我写过一篇《央视下场宣传国产模型,Kimi K3真有实力,赶超国外顶级模型!》),现在拿数据一对,确实站在了第一梯队的门槛上。

所以国产的真实位置是:有能打的,但不是 DeepSeek 这一款在打硬仗。

二、那 DeepSeek 在打什么仗?看牌桌一:价格

理解了"绝对能力有差距”,再看 DeepSeek 的定价,你就懂了它的算盘。

DeepSeek V4 Pro 0813 每百万 Token 输入 $0.435、输出 $0.87。什么概念?看看全球旗舰的行情(OpenRouter 数据):

  • OpenAI GPT-5.6(terra):$1.0 / $6.0
  • Google Gemini 3.1 Pro:$2.0 / $12.0
  • Anthropic Claude Opus 5:$5.0 / $25.0

DeepSeek 比最便宜的 GPT-5.6 还便宜一半多,比 Claude Opus 5 便宜 11 倍。

而且这还不是最狠的——DeepSeek 还有 V4 Flash(284B 总参 / 13B 激活),百万 Token 输入只要 $0.08、输出 $0.18。这个价格,全球没有第二家能给。

翻译成人话:用 Claude 十分之一的钱,拿到七八成的能力。

这对"追求极致能力、预算不敏感"的用户没吸引力,但对"按 Token 烧钱"的场景——企业批量处理、Agent 流水线、客服机器人——这笔账算下来,DeepSeek 就是唯一解。

牌桌一的结论:论"单位智能的价格",国产已经是全球最低,没有之一。 这不是便宜没好货,是 MoE 稀疏激活 + 自研训练框架 + 自建智算集群,把成本真打了下来。

三、牌桌二:开源生态,全球前二都是中国的

这是最容易被低估、但其实最厉害的一点。

同期上线的另一个国产旗舰——Qwen3.8 2.4T A95B,是阿里 Qwen3.8 Max 旗舰的开源权重版:2.4 万亿总参数、950 亿激活,256K 上下文。

而目前 OpenRouter 上架的开放权重模型里,参数规模前两名是:

  1. Kimi K3:2.8 万亿参数(月之暗面)
  2. Qwen3.8 2.4T:2.4 万亿参数(阿里)

前两名,全是中国的。

DeepSeek 全系 MIT 协议开源,Qwen 从 1.8B 到 2.4T 全系开源,Kimi K3 也是开放权重。这意味着全球开发者——包括硅谷的团队——在搭自己的 AI 应用时,越来越多直接拿国产开源模型当地基。不是因为它便宜,是因为能力够用,而且能自己掌控

当一个国家的模型成为全球开发者的"默认选择",这就不只是技术领先了,是生态主导权

牌桌二的结论:闭源旗舰的绝对能力,美国还领先;但开源世界的地基,国产已经铺好了。

四、牌桌三:长上下文,已经站进"1M 俱乐部"

  • DeepSeek V4 Pro 0813:100 万 Token(最大输出 384K)
  • Kimi K3:100 万 Token

现在全球第一梯队的上下文水平:GPT-5.6 系列 1.05M、Claude Opus 5 1M、Gemini 3.1 Pro 1M、Grok 4.20 甚至做到了 2M。

百万上下文意味着什么?一次性喂进去一整套代码库、一整本书、几百页合同,模型都能记住。

国产旗舰与全球顶级选手站到了同一条线上——这在两年前是不敢想的。

五、牌桌四:用户生态,开发者用脚投票

模型强不强,开发者用脚投票。

OpenRouter 是全球最大的模型聚合平台,开发者在这里用真实调用量给模型打分。国产模型在这上面的热度,这两年一路走高——DeepSeek 系列长期霸榜调用量前列,Qwen 系列更是全球开源部署量的绝对主力。

为什么?回到牌桌一的逻辑:能力够用 + 价格便宜 + 开源可控,这三个条件凑齐,开发者没有理由不用。

而且开源带来一个闭源模型给不了的东西:确定性。闭源模型今天好用,明天厂商一改 API、一调价格、一砍功能,你的应用就悬了。开源模型握在自己手里,想怎么改怎么改。

牌桌四的结论:在"开发者实际在用"这件事上,国产已经是主流选择之一。

六、四张牌桌摆完,账就清楚了

牌桌国产位置
绝对能力(基准测试)落后第一梯队,Kimi K3 追到 2~5 分 ⏳
价格全球最低,DeepSeek 领先所有旗舰 ✅
开源生态全球前二都是中国的 ✅
长上下文1M 俱乐部,与顶级并跑 ✅
用户生态开发者主流选择之一 ✅

一句话总结:DeepSeek V4 Pro 0813 确实没有别人吹的那么强——它强在"便宜",不在"最强"。但国产阵营整体,在价格、开源、长上下文、用户生态这四张牌桌上已经是领跑者,只有"绝对能力"这一张还在追赶。

这个格局,对行业、对每个开发者,都是好事:

  • 想要绝对最强?Claude Opus 5 / GPT-5.6 Sol,但准备好钱包
  • 想要极致性价比?DeepSeek V4 Pro 0813($0.435/$0.87)或 V4 Flash($0.08/$0.18)
  • 想要开源可控 + 自己部署?Qwen3.8 2.4T A95BKimi K3
  • 想要国产最强硬实力 + 编程?Kimi K3($3/$15,三项基准全球前四)

别被"吊打"的标题冲昏头,也别被"差距"的数据吓退。看清每张牌桌上的胜负,选对适合自己场景的模型,才是正经事。


数据来源:OpenRouter 官方模型 API、Artificial Analysis 基准指数(2026-08-13 抓取)。