因为内容相关性较差本文没有发表在Linux用户站。

DeepSeek V4正式版来了,但只来了一半:Flash版“倒反天罡”,Agent能力暴打Pro预览版

xfox.fun/archives/{cid}/

因为内容相关性较差本文没有发表在 Linux 用户站

2026年7月31日午后,DeepSeek通过API文档发布日志,宣布DeepSeek-V4-Flash正式版API上线公测。消息一出,DeepSeek迅速冲上知乎热搜第一。

但与常规认知中“Pro强、Flash弱”的分层逻辑完全不同——这次Flash正式版在Agent能力上实现了对自家Pro预览版的全面反超

一、“倒反天罡”:Flash凭什么暴打Pro Preview?

DeepSeek-V4-Flash正式版(模型版本号DeepSeek-V4-Flash-0731)的模型结构、尺寸与预览版完全一致——总参数2840亿,激活参数仅130亿。官方表示,仅重新进行了后训练

就是这个“仅重新进行了后训练”,带来了质的飞跃。官方公布的9项Agent基准测试成绩如下:

基准测试得分
Terminal Bench 2.1(终端操作)82.7
Cybergym(网络安全攻防)76.7
Toolathlon Verified(工具调用)70.3
DSBench-FullStack(内部全栈开发)68.7
DSBench-Hard(高难度编码)59.6
NL2Repo(代码仓库理解与修改)54.2
DeepSWE(AI编程)54.4
Agent Last Exam25.2
Automation Bench Public25.1

最夸张的是DeepSWE测试——从预览版的7.3分暴涨到54.4分,性能提升超过6倍。而V4-Pro预览版在Terminal Bench 2.0上的得分仅为67.9分。

虽然Terminal Bench 2.0与2.1并非同一版本测试集,直接对比不完全公平,但一个激活参数仅130亿的轻量版模型,在Agent能力上跑出这样的分数,已经足够说明问题:后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应

海外模型评测机构Artificial Analysis在7月31日更新的智能指数测试中,给予V4-Flash-0731(最高推理档位)50分,在同类可比模型中明显高于平均水平(可比模型的中位数为17分)。

二、后训练仙人:同样的骨架,不同的灵魂

这次升级的技术路径值得深思。

DeepSeek官方明确表示,V4-Flash-0731的模型结构和尺寸与预览版完全一致,仅重新进行了后训练。这意味着DeepSeek在训练方法和数据质量上找到了突破口——同样的模型“骨架”,经过更精细的训练策略调优,就能在基准测试中产生质的飞跃。

DeepSeek-V4-Pro总参数1.6万亿,激活参数490亿;V4-Flash总参数2840亿,激活参数130亿。两者在模型规模上相差一个数量级。如果Flash能通过后训练把Agent能力拉到接近Pro预览版的水平,那意味着对于特定任务而言,模型规模并非决定性因素

网友评论精辟:“DeepSeek这一波真的是后训练仙人了”

此外,官方还特别注明,公开基准测试中的Code Agent任务使用了DeepSeek Harness极简模式作为框架进行测试。这是DeepSeek官方自研Harness首次以正式命名出现。据透露,DeepSeek的Harness团队组建于今年3月,挂帅者崔添翼是90后,浙大计算机出身,手握6枚ACM亚洲区域赛金牌。

三、生态暗战:原生支持Responses API,适配Codex

这次更新另一个值得关注的信号是生态层面的布局。

正式版V4-Flash原生支持Responses API格式,并针对性适配了Codex。Responses API是OpenAI用于统一处理模型输出、推理过程和工具调用的一套接口格式,也是Codex客户端与模型交互的主要接口之一。现在,开发者可以在Codex CLI、ChatGPT桌面端和VS Code的Codex插件中,将DeepSeek配置为模型提供方。

这意味着DeepSeek正在从模型层向工具链层渗透。目前Responses API只支持V4-Flash,V4-Pro预计8月初接入。

四、资本加持后的第一次技术兑现

这次升级距离DeepSeek完成首轮融资不到两个月。今年6月,DeepSeek完成首轮外部融资,总额超74亿美元(约合500亿元),投后估值超500亿美元(约合3380亿元) ,创下中国AI行业单轮融资纪录。

资本加持下的第一次技术兑现,Flash版交出了一份令人瞩目的成绩单。

五、美中不足:只来了一半

当然,也有一些遗憾。

本次升级仅限于DeepSeek-V4-Flash的API接口,DeepSeek-V4-Pro API及APP/WEB端模型均未做更改。大家常用的App和网页端暂时无法体验最新能力。

DeepSeek表示,V4-Pro正式版将会“尽快发布” 。有消息称V4-Pro预计8月初正式发布。

网友已经开始期待:“V4-Flash已经这么强,真不敢想象V4-Pro会有多强!该不会是明天吧!?”

六、行业视角:Agent战争的大幕刚刚拉开

如果说2023年的大模型竞争是“拼通用能力”,2024年是“拼长上下文”,那么2026年的关键词,毫无疑问是Agent

Agent能力——即模型自主规划、调用工具、执行复杂任务的能力——正在成为衡量大模型实力的新标尺。从全球范围看,Agent能力的第一梯队目前仍由闭源巨头把持。但DeepSeek-V4-Flash正式版在多项Agent基准上的表现已经逼近Opus 4.8,而价格只有Claude的1/90

有网友让GPT整理了V4 Flash对比其他大模型的性能测试,结论是性价比上Flash依然无敌,比降价后的GPT-5.6 Luna还要少一半的费用

V4-Flash只用1/10到1/3的参数量就做到了前沿级性能。而V4-Pro是1.6万亿参数量,规模大了4倍以上。按照这个幅度来算,V4-Pro正式版的性能达到甚至超过K3、Opus 5、GPT-5.6 Sol都是有可能的


总结: 2026年7月31日,DeepSeek-V4-Flash正式版API上线公测。Flash版以2840亿总参数、130亿激活参数的“小身板”,在9项Agent基准测试中全面超越V4-Pro预览版,DeepSWE测试更是从7.3分暴涨至54.4分,性能提升超6倍。同时原生支持Responses API并适配Codex,生态野心初显。V4-Pro正式版预计8月初发布——Flash已经这么强了,Pro得有多猛?

本文数据来源:DeepSeek官方API更新日志、IT之家、凤凰网科技、观察者网、快科技等

标签: none

添加新评论