8 月 12 日,DeepSeek 在官方文档站悄然上架了 V4 Pro 0813——这是 V4 Pro 系列的首个正式版(GA)。没有发布会、没有宣传稿,却在当晚以 970 分登顶 Hacker News,并同时占据 HN 首页两个相关条目,成为过去 48 小时全球 AI 社区讨论度最高的事件。
三个月前发布的 V4 Pro Preview 已经凭借接近旗舰模型的推理能力站稳脚跟,而 0813 版本带来的远不只是基准分数的提升:1M 上下文、384K 最大输出、Anthropic API 兼容、峰谷计费……每一项都在回应同一个问题——当模型能力逼近 OpenAI 与 Anthropic 旗舰时,DeepSeek 打算用什么方式赢下这场竞赛?
值得注意的是,这已经是 DeepSeek 在一周内第二次震动社区:此前 V4 Flash 0731 凭借惊人的本地部署表现刷新了开源模型的性价比认知,而这次的 Pro 正式版,则把战火烧向了云端 API 的商业模式本身。
一、从 Preview 到 GA:规格表里藏着什么
根据 OpenRouter 与 DeepSeek 官方文档,V4 Pro 0813 是一枚大规模混合专家(MoE)模型,上下文窗口达到 1,048,576 token(1M),单次最大输出 384K token,输入输出均为纯文本。作为对比,V4 Flash 0731 同样支持 1M 上下文,但 0813 的 API 并发上限只有 500,远低于 Flash 的 2500——官方显然把它定位为"质量优先"的旗舰型号,宁可牺牲并发吞吐也要保证单次推理质量。
技术上最值得注意的变化是"思考模式"的默认开启:模型支持非思考与思考双模式,默认走思考路径,并可通过 reasoning effort 参数在 low / high / max 三档之间切换。这意味着 API 底层采用了"隐藏思维链 + 可配置推理预算"的架构——用户可以在低延迟任务上关掉思考、在复杂问题上拉满推理预算,而 DeepSeek 的工程团队把这一切做成了标准化的开放接口,原生支持工具调用、JSON 输出与 Responses API。
从架构哲学上看,这种"预算可配置"的思路与 OpenAI o 系列一脉相承,但 DeepSeek 把它推得更远:不仅是开关切换,而是把推理成本的控制权直接交给了开发者,为后文提到的峰谷定价埋下了伏笔。
二、成绩单:Agentic 编码全面反超 Opus 4.8
社区流传的基准对照表(源自 r/LocalLLaMA)显示,0813 在多个 Agentic 场景已实现对 Claude Opus 4.8 的反超:Terminal Bench 2.1 拿到 87.9 分(Opus 4.8 为 85.0)、Cybergym 83.3(78.3)、DeepSWE 62.7(58.0)、Toolathlon-Verified 74.1 也仅以毫厘之差落后于 76.2。也就是说,在"终端操作、攻防演练、真实仓库修复"这类 agent 最常被雇佣的场景里,0813 已经是第一梯队。
但在纯智力基准上仍有差距:HLE(无工具)42.7 对 Opus 4.8 的 49.8,NL2Repo 61.5 对 69.7,DSBench-Hard 67.2 对 71.7。综合来看,0813 与 Opus 4.8 互有胜负,与 Kimi-K3 在近一半基准上打得难分难解——而它的价格,只有对手的约二十分之一。HN 评论区那句"Competitive with Opus 4.8, about 20x cheaper",精准概括了它的市场定位。
Artificial Analysis 的独立评测给出了相近的结论:0813 处于"智能第一梯队",推理速度高于平均水平,但输出略显冗长(verbose)。这个"冗长"的代价在按 token 计费的 API 时代被放大,却也侧面印证了它确实在认真思考——思考深度与输出效率之间的平衡,将是后续版本持续调优的方向。
三、峰谷定价:API 计费的一次「电力化」改造
最具行业颠覆性的或许是定价模式。8 月 16 日 16:00 UTC 起,DeepSeek 将实施峰谷计费:高峰时段(01:00-04:00 与 06:00-10:00 UTC)按全价计费,其余时段一律半价。这在大模型 API 行业属于首创——把 GPU 算力当作电力资源来调度,用价格杠杆把推理负载平移到低谷期,本质上是一次"需求响应"实验。
具体价格方面:0813 输入 $0.435 / M token(缓存命中低至 $0.003625 / M)、输出 $0.87 / M;Flash 0731 则为 $0.14 / M 输入、$0.28 / M 输出。有 HN 用户抱怨"官方 API 今天起涨价了",但从另一个角度看,半价窗口给了批量任务与 agent 调度器一个明确的优化信号:把非实时任务排进低谷时段,成本直接减半。
这种定价策略的深层逻辑是算力资源的时间套利:数据中心夜间负载低,闲置的 GPU 是沉没成本,与其空转不如半价卖出。对重度 API 用户而言,这相当于获得了一个官方的"电价表",精打细算的团队甚至可以把每日的推理任务按时段重新编排。
四、兼容性策略:把自己做成「平替基础设施」
0813 同时支持 DeepSeek 原生格式与 Anthropic API 格式(base URL 指向 api.deepseek.com/anthropic),并全面支持 Responses API、工具调用与 JSON 输出。这意味着现有 Claude 生态的代码几乎可以零成本迁移——对开发者来说,切换成本被压到了最低,这也是它能快速抢占开发者心智的关键。
代码层面,切换思考档位的调用非常直观:
from openai import OpenAI
client = OpenAI(base_url="https://api.deepseek.com", api_key="...")
resp = client.responses.create(
model="deepseek-v4-pro-0813",
reasoning={"effort": "high"},
input=[{"role": "user", "content": "重构这个模块"}],
)
这种"接口平替"策略,与 Flash 版此前验证过的本地部署路径形成组合拳:云端便宜、本地可跑,开发者可以在两者之间自由迁移,OpenRouter 等聚合平台也为它提供了多个上游供应商。而数据主权问题则留给用户自己权衡——HN 评论区里"不想把数据送到中国"的担忧,与"20 倍价差无法忽视"的理性计算,形成了一场有趣的拉锯。
五、结语:价格战的下半场是调度战
970 分的关注度证明了一件事:大模型竞赛的焦点,正在从"谁更聪明"转向"谁的基础设施更聪明"。V4 Pro 0813 在智力上并没有碾压 Opus 4.8,但它用 1M 上下文、384K 输出、峰谷定价与 API 兼容,把"够用的智力 + 极致的性价比"做成了完整的商业闭环。
对 OpenAI、Anthropic 而言,DeepSeek 连续两个版本的组合拳已经构成实质性压力:旗舰定价体系正在被"便宜二十倍还够用"的叙事瓦解,而 Anthropic 同期推出的隐形水印与内容追溯机制,更是把一部分在意隐私的开发者推向了开源阵营。
当推理成本低到可以随意挥霍,agent 的编排方式就会改变:更长的上下文、更大的搜索空间、更精细的 reasoning 预算调节。这场由 DeepSeek 掀起的「推理经济学」革命,才刚刚进入下半场。