截至 2026 年 8 月 16 日的结论:DeepSeek V4 已进入正式版阶段。API 当前提供 deepseek-v4-pro 与 deepseek-v4-flash:前者对应 DeepSeek-V4-Pro-0813,后者对应 DeepSeek-V4-Flash-0731。两者均支持 1M 上下文、最大 384K 输出、思考与非思考模式、工具调用、JSON Output、Responses API 和 Anthropic API。旧模型名 deepseek-chat、deepseek-reasoner 已于 2026 年 7 月 24 日停止访问,仍使用旧名称的程序应立即迁移。
先说选择:高并发、常规问答、抽取、分类和批量处理先评估 V4-Flash;复杂代码修改、长链路 Agent 和错误成本较高的推理任务再评估 V4-Pro。不要因为官方基准更高就默认全部切到 Pro,应使用自己的固定测试集比较任务成功率、P95 延迟、Token 消耗和人工复核通过率。
DeepSeek V4 Pro 正式版更新了什么?
DeepSeek 官方更新日志显示,V4-Pro 正式版于 2026 年 8 月 13 日同步上线 APP、网页端和 API,API 模型名仍为 deepseek-v4-pro。官方同时公布多项 Agent 与代码任务基准结果,并宣布原生支持 Responses API。这里的分数属于厂商在其说明条件下公布的结果,不等同于本站实测,也不能直接推导到你的业务。
本次更新还为 V4-Pro 和 V4-Flash 增加 low、high、max 三档思考强度。简单任务可从 low 开始,日常 Agent 任务可评估 high,只有在复杂任务确有收益时再使用 max。强度越高通常意味着更长响应时间和更多 Token,应该把质量、成本和延迟放在同一张验收表里。
| 项目 | DeepSeek V4 Pro | DeepSeek V4 Flash |
|---|---|---|
| API 模型名 | deepseek-v4-pro |
deepseek-v4-flash |
| 当前版本 | DeepSeek-V4-Pro-0813 | DeepSeek-V4-Flash-0731 |
| 上下文 / 最大输出 | 1M / 384K | |
| 思考模式 | 思考与非思考;支持 low、high、max 强度 | |
| 接口 | Chat Completions、Responses API、Anthropic API | |
| 结构化与工具 | JSON Output、Tool Calls;FIM 仅非思考模式 | |
| 官方并发限制 | 500 | 2500 |
模型版本、能力与并发数据复核于 2026 年 8 月 16 日,来源为 DeepSeek 官方“模型与价格”和更新日志。平台配置可能继续变化,生产部署前请重新打开官方页面确认。
2026 年 8 月 17 日后的峰谷价格
DeepSeek 公告显示,新价格于北京时间 2026 年 8 月 17 日 0 时生效。高峰时段为 9:00–12:00、14:00–18:00,其余为闲时。下面均按“每百万 Token”计价:
| 模型与时段 | 缓存命中输入 | 缓存未命中输入 | 输出 |
|---|---|---|---|
| V4-Flash 闲时 | 0.05 元 | 1.5 元 | 4.5 元 |
| V4-Flash 高峰 | 0.10 元 | 3.0 元 | 9.0 元 |
| V4-Pro 闲时 | 0.15 元 | 4.5 元 | 13.5 元 |
| V4-Pro 高峰 | 0.30 元 | 9.0 元 | 27.0 元 |
对于离线评测、批量摘要、索引构建和非实时 Agent,可以把允许延后的任务排到闲时;在线客服或交互应用则不应为了价格牺牲响应时限。预算模型还要计入重试、工具调用、多轮历史和失败请求,不能只用单次输入长度乘单价。
V4-Pro 和 V4-Flash 怎么选?
- 优先测试 V4-Flash:常规问答、分类、抽取、摘要、基础 RAG、批量内容处理,以及延迟和并发更重要的任务。
- 优先测试 V4-Pro:复杂代码仓库修改、需要多步工具调用的 Agent、难度较高的推理和错误代价较大的任务。
- 采用双模型路由:先由 Flash 处理常规请求;达到复杂度阈值、低置信度、连续失败或人工指定时再切换 Pro。
- 不要用品牌名当验收:固定提示、输入和评分规则,重复运行并记录成功率、P95 延迟、Token 与人工复核结果。
最小迁移步骤
- 搜索旧模型名:检查代码、环境变量、容器、CI/CD、数据库、低代码工作流、定时任务和监控告警。
- 冻结现状基线:抽取脱敏的真实请求,记录当前成功率、延迟、Token、工具调用和人工复核结果。
- 集中模型配置:把模型名放到环境变量或配置中心,不要散落硬编码。
- 分开验证模式:非思考、low、high、max 分别测试;工具调用和多轮对话必须覆盖。
- 小流量灰度:按用户、任务或请求比例放量,监控错误码、超时、结构化输出失败和成本。
- 准备有效回滚:回滚到已验证的新模型配置,不能再把已经停用的旧模型名当作退路。
Python 调用示例
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model=os.getenv("DEEPSEEK_MODEL", "deepseek-v4-flash"),
messages=[
{"role": "system", "content": "请给出简洁、可核验的答案。"},
{"role": "user", "content": "列出 API 灰度上线的三个验收指标。"},
],
extra_body={"thinking": {"type": "enabled"}},
reasoning_effort="high",
stream=False,
)
print(response.choices[0].message.content)
生产环境建议通过 DEEPSEEK_MODEL 切换模型。密钥只能保存在服务端环境变量或密钥管理服务中,不要写入前端、公开仓库、截图或日志。不同 SDK 版本对扩展参数的传递方式可能不同,上线前应以官方示例和当前 SDK 文档为准。
Responses API 迁移时要检查什么?
官方更新说明称 V4 Pro 与 V4 Flash 原生支持 OpenAI Responses API 格式。接口兼容不代表业务可以零测试切换:至少需要核对输入消息结构、流式事件、工具调用、错误处理、用量字段和会话状态。如果现有程序依赖 Chat Completions 的特定返回路径,应在适配层统一转换,而不是在业务代码中同时散布两套解析逻辑。
思考模式下还要单独测试多轮与工具调用。不要把思考内容当作稳定业务字段,也不要写入面向用户的审计结论;真正应该保存的是输入版本、模型 ID、工具请求、工具结果、最终回答、错误码和必要的追踪标识。
上线验收表
| 检查项 | 通过标准示例 | 失败动作 |
|---|---|---|
| 任务成功率 | 固定测试集不低于当前基线 | 停止放量并定位失败类型 |
| 结构化输出 | JSON 可解析且字段校验通过 | 重试受限,失败进入人工队列 |
| 工具调用 | 工具选择、参数和结果回传正确 | 关闭高风险写入工具 |
| 延迟 | P95 在业务时限内 | 降低思考强度或路由 Flash |
| 成本 | 单任务费用在预算阈值内 | 限制上下文、重试和输出长度 |
| 安全 | 密钥、隐私和系统提示不进入日志 | 阻断请求并启动泄露处置 |
常见问题
base_url 需要修改吗?
使用 OpenAI 兼容格式时仍是 https://api.deepseek.com;Anthropic 兼容格式使用官方列出的 https://api.deepseek.com/anthropic。模型名必须改为当前明确的 V4 名称。
deepseek-chat 和 deepseek-reasoner 还能用吗?
不能再把它们作为可用方案。DeepSeek 官方在 2026 年 4 月的迁移公告中给出三个月过渡期,并明确两者于 7 月 24 日停止访问。应排查所有隐藏配置和备用任务,而不是只修改主服务。
1M 上下文是否意味着可以直接塞入整个知识库?
不建议。上下文容量是上限能力,不是推荐输入长度。检索、去重、权限过滤、引用定位和敏感信息控制仍然必要;过长输入还会增加延迟与费用,并可能稀释真正相关的信息。
本文做过 V4 Pro 与 Flash 的独立跑分吗?
没有。本文只核验官方可用性、模型参数、接口和价格,并提供可复现的业务验收方法。文中提到的厂商基准不标记为本站实测;后续若开展独立测试,会公开测试集、参数、时间和限制。
官方来源与站内延伸
- DeepSeek API 更新日志(官方)
- DeepSeek 模型与价格(官方)
- DeepSeek 思考模式(官方)
- DeepSeek Responses API(官方)
- DeepSeek Chat Completions API(官方)
- Kimi K3、DeepSeek V4、GPT-5.6、Claude 5 怎么选
- AI 智能体与自动化:权限、测试和回滚
- DeepSeek 使用攻略:面向普通用户的入口与边界
- AI 教程栏目:更多 API 与工具实操
编辑复核与纠错记录
本文由兰塞 AI 编辑流程于 2026 年 8 月 16 日复核。此次更新保留原 URL、发布时间与原创迁移图,删除“V4 Preview”“旧模型即将停用”等过期表述,补充 V4-Pro-0813、V4-Flash-0731、Responses API、思考强度与 8 月 17 日峰谷价格。事实来源均为 DeepSeek 官方文档;本站未把官方基准写成独立实测。本站的来源、更新与纠错原则见关于本站与编辑规范。