← 返回全部文章

DeepSeek V4 Pro 0813 正式版发布,部分测试超过 Fable 5

DeepSeek V4 Pro 0813 正式版发布。按公开对比表,部分测试项目超过 Fable 5,但这仍是单张基准表,不能等同于全面领先。

DeepSeek V4 Pro 0813 正式版发布。

根据目前流传的公开对比表,V4 Pro 在部分测试项目上超过 Fable 5,也有多项成绩高于 Opus 4.8 。表格显示,DeepSeek V4 Pro 0813 在 Cybergym 、 DeepSWE 、 AutomationBench(Public)等项目中拿到较高成绩,但在 HLE 、 Terminal Bench 2.1 、 DeepSWE 、 Toolathlon-Verified 和 DSB​​ench-FullStack 等项目上,Fable 5 仍然领先。

换句话说,这次发布的看点不是“全面超过所有模型”,而是国产模型在复杂代码、工具调用和自动化任务上的对比成绩继续往前走。

目前能确认什么

  • DeepSeek V4 Pro 0813 已有正式版发布信息流传;
  • 对比表包含 HLE 、 Terminal Bench 2.1 、 NL2Repo 、 Cybergym 、 DeepSWE 、 Toolathlon-Verified 、 Agents’ Last Exam 、 AutomationBench 、 DSBench 等项目;
  • V4 Pro 在部分项目中超过 Fable 5;
  • Fable 5 依然在多项测试中保持优势;
  • 公开信息还不足以证明 V4 Pro 在所有任务、所有成本和所有实际工作流中都全面领先。

公开基准对比表

价格可能是更大的变量

这条消息里另一个值得注意的点,是价格差异。

相关分享将 DeepSeek V4 Pro 与 Fable 5 的价格差距描述为约 100 倍。不过,这个数字需要结合具体 API 版本、输入输出 Token 价格、缓存策略、上下文长度和计费方式确认,不能只看一个简单倍数。

如果性能接近,价格差距就会直接影响开发者的选择:

  • 个人开发者会更在意调用成本;
  • 企业会比较稳定性、限流、数据处理和服务协议;
  • Agent 产品会关注长任务中的失败率和重试成本;
  • 编程工作流会关注代码修改是否可验证,而不只是单次榜单成绩。

对于模型用户来说,真正需要观察的是“效果、价格、稳定性”三项能不能同时成立。

还需要继续观察

目前这张表更适合作为发布快讯和后续测试线索,不宜直接当成完整评测。后续还需要看:

  1. 官方模型页面和 API 是否同步更新;
  2. 各项基准的测试设置是否一致;
  3. 是否包含工具、 Fallback 或特殊提示词;
  4. 同一模型多次运行时的成绩稳定性;
  5. 实际代码任务中的成功率、延迟和重试次数;
  6. 正式价格和服务限制是否发生变化。

短期看,DeepSeek V4 Pro 0813 的发布会增加国产模型在代码和 Agent 场景中的竞争力。长期能不能改变开发者的默认选择,还要看真实项目里的成本和稳定性。

来源:https://x.com/oran_ge/status/2087662930171166804