7 月 31 日,DeepSeek 官网宣布,V4-Flash 正式版 API 上线公测,Agent 能力大幅增强;V4-Pro 暂未变动。

DeepSeek 官方更新公告
这次正式上线的不是整个 V4 系列,只是 V4-Flash 的 API。V4-Pro、App 和网页端都没有更新,目前也没看到 V4-Flash-0731 权重同步开源的公告。
现有 API 用户不需要更换模型名,继续使用 deepseek-v4-flash,就会调用到 V4-Flash-0731。
这次没有新架构,模型尺寸也没变。
DeepSeek 只重新做了后训练,公布的成绩几乎都在测 Agent;API 这边则新增了 Responses 格式,并专门适配 Codex。
结构尺寸不变,只重新做了后训练
DeepSeek 在 4 月 24 日发布并开源了 V4 预览版,包括 V4-Pro 和 V4-Flash。Pro 总参数量为 1.6T、每次推理激活 49B 参数;Flash 总参数量为 284B、激活 13B 参数,两者都支持 100 万 Token 上下文。
模型完成预训练后,还可以通过监督微调、偏好对齐、强化学习等后训练方法,改变它理解指令、选择工具和处理执行反馈的方式,不一定非要调整模型结构。
DeepSeek 没有披露 V4-Flash-0731 具体用了什么方法,只说重新进行了后训练。随后给出的九项成绩,覆盖终端操作、代码库理解、软件工程、工具调用和自动化任务。
DeepSeek 称这些成绩“远超 V4-Pro-Preview”。其中,Terminal Bench 2.1 为 82.7,Toolathlon verified 为 70.3。
官方注明,公开基准中的 Code Agent 任务使用了尚未发布的 DeepSeek Harness 极简模式,采用 Max 档位,top_p=0.95、temperature=1.0;DSBench-FullStack 和 DSBench-Hard 则是内部测试集。模型、Harness、提示词、工具和运行参数共同影响结果。
换句话说,这些跑分测到的是特定配置下的整套 Agent 系统,不是一个脱离工具和框架的模型。外部还没法按相同条件复现。
Responses API不只是换了请求地址
Chat Completions 和 Responses API 都由 OpenAI 定义。前者推出得更早,后来不少第三方模型服务也照着实现接口。大家习惯称其为“OpenAI 兼容格式”,但它并不是独立标准组织制定的行业标准。
Chat Completions 围绕消息组织请求和返回:开发者提交一组 messages,再从 choices 中读取模型回复。它也支持结构化的 tool_calls,并不需要程序从自然语言里猜工具意图。
2025 年 3 月,OpenAI 推出 Responses API,称它是从 Chat Completions 演进而来的新 API primitive,把对话和 Agent 所需的工具能力放进同一套接口。Chat Completions 仍受支持,不过 OpenAI 已建议新项目优先使用 Responses API。
Responses API 的差别,是把消息、推理项(reasoning)、工具调用和工具结果组织成独立的 Items。工具执行完,宿主程序把结果作为对应的 item 传回去,模型再接着做。流式响应也会按事件类型区分文本、函数参数、工具状态、完成和失败;OpenAI 自己的实现还提供会话状态和多种内置工具。
对 Agent 框架来说,这套接口把模型输出、工具执行和状态事件放进同一种 item/event 结构里,更方便宿主程序处理多步任务。它是对 Chat Completions 工具调用能力的扩展,不是从“自然语言工具调用”到“结构化工具调用”的第一次跨越。
比如 Codex 要修改一个文件,模型先返回一次 apply_patch 工具调用,Codex 执行修改,再把结果送回模型。模型看到执行结果后,决定继续改、运行测试,还是结束任务。Responses API 负责把这些不同步骤按类型传递,而不是把整段过程压成一条聊天回复。
一次典型的 Codex 工具调用循环。DeepSeek 当前只支持 Responses API 的部分能力。
DeepSeek 兼容这套格式,但目前只实现了其中一部分。
Codex已经转向Responses API
DeepSeek 的文档说得很直接:增加 Responses API,就是“为了满足大家对 Codex 的需求”。
Codex 把与模型服务通信的方式叫作 wire_api。它早期同时支持 chat/completions 和 Responses,OpenAI 在 2025 年 12 月宣布弃用前者。现在的配置参考只列出 responses,自定义模型服务需要对外提供 Responses API。
这和 Codex 的工作方式有关。它不只让模型生成代码,还要接收工具调用,把改文件、跑命令的结果送回模型,然后继续下一步。Responses API 表达的正是这样的执行循环。
DeepSeek 这次没有只做接口转换。V4-Flash-0731 重新进行了后训练,公布的重点是 Agent 基准;API 则实现了 function call、function call output、服务端网页搜索,以及 Codex 使用的 apply_patch 自定义工具。
后训练指向模型在 Agent 任务中的表现,Responses API 解决 Codex 如何传递任务和工具结果。DeepSeek 同时补这两边,才是这次适配真正值得看的地方。
开发者现在可以照着官方配置把 V4-Flash 接进 Codex,不必先维护一套基础协议转换。如果 Responses API 客户端直接依赖服务端状态、内置 MCP、文件输入或其他尚未支持的能力,仍然要自己处理。这里说的是 Responses API 的 mcp 内置工具,不是 Codex 宿主侧另行管理的 MCP 服务。
不过,能接入不等于完整兼容。DeepSeek 的兼容性列表里还有不少缺口:
previous_response_id和conversation不支持,DeepSeek Responses API 仍然无状态;background不支持;file_search、code_interpreter、computer_use和 Responses API 的mcp等内置工具会被忽略;- 图片和文件输入不受支持,
input_image不会报错,而是被替换为占位文本; - 不支持的顶层参数会被静默忽略;
custom工具只有apply_patch可用,其他名称会返回 400 错误。
最容易踩坑的是“静默忽略”。请求成功了,不代表每项配置都生效。
迁移现有 Responses API 客户端时,依赖哪些参数和工具,还是得逐项对照。
总结
目前 DeepSeek 的 Responses API 只支持 V4-Flash。
官方文档称,V4-Pro 预计在 8 月初接入。至少在这一刻,Flash 先进入了 Codex 使用的接口链路。
DeepSeek 这次做的,不只是给 V4-Flash 增加一个 Codex 配置入口。后训练指向模型的 Agent 能力,Responses API 则让这些能力进入现有开发工具的执行循环。
参考资料
- DeepSeek,更新日志:https://api-docs.deepseek.com/zh-cn/updates
- DeepSeek,使用 Responses API:https://api-docs.deepseek.com/zh-cn/guides/responses_api
- DeepSeek,V4 预览版发布:https://api-docs.deepseek.com/zh-cn/news/news260424/
- DeepSeek,V4-Flash 官方模型页:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
- DeepSeek,接入 Agent 工具:https://api-docs.deepseek.com/zh-cn/guides/coding_agents/
- DeepSeek,集成 Deep Code:https://api-docs.deepseek.com/zh-cn/quick_start/agent_integrations/deepcode
- OpenAI,Codex 高级配置:https://learn.chatgpt.com/docs/config-file/config-advanced
- OpenAI,Codex 配置参考:https://developers.openai.com/codex/config-reference
- OpenAI,Codex 弃用 Chat Completions 讨论:https://github.com/openai/codex/discussions/7782
- OpenAI,构建 Agent 的新工具:https://openai.com/index/new-tools-for-building-agents/
- OpenAI,迁移到 Responses API:https://developers.openai.com/api/docs/guides/migrate-to-responses