AI教程

DeepSeek V4 Pro 正式版 API 指南:价格、思考强度与迁移

DeepSeekV4Pro正式版与V4Flash怎么选?本文核对0813/0731版本、1M上下文、ResponsesAPI、思考强度、8月17日峰谷价格,并给出迁移、测试和回滚清单。

本页目录
  1. DeepSeek V4 Pro 正式版更新了什么?
  2. 2026 年 8 月 17 日后的峰谷价格
  3. V4-Pro 和 V4-Flash 怎么选?
  4. 最小迁移步骤
  5. Python 调用示例
  6. Responses API 迁移时要检查什么?
  7. 上线验收表
  8. 常见问题
  9. base_url 需要修改吗?
  10. deepseek-chat 和 deepseek-reasoner 还能用吗?
  11. 1M 上下文是否意味着可以直接塞入整个知识库?
  12. 本文做过 V4 Pro 与 Flash 的独立跑分吗?
  13. 官方来源与站内延伸
  14. 编辑复核与纠错记录

截至 2026 年 8 月 16 日的结论:DeepSeek V4 已进入正式版阶段。API 当前提供 deepseek-v4-prodeepseek-v4-flash:前者对应 DeepSeek-V4-Pro-0813,后者对应 DeepSeek-V4-Flash-0731。两者均支持 1M 上下文、最大 384K 输出、思考与非思考模式、工具调用、JSON Output、Responses API 和 Anthropic API。旧模型名 deepseek-chatdeepseek-reasoner 已于 2026 年 7 月 24 日停止访问,仍使用旧名称的程序应立即迁移。

先说选择:高并发、常规问答、抽取、分类和批量处理先评估 V4-Flash;复杂代码修改、长链路 Agent 和错误成本较高的推理任务再评估 V4-Pro。不要因为官方基准更高就默认全部切到 Pro,应使用自己的固定测试集比较任务成功率、P95 延迟、Token 消耗和人工复核通过率。

DeepSeek V4 API 从旧模型名迁移到 V4-Pro 与 V4-Flash 的步骤
DeepSeek V4 API 迁移路线:盘点旧模型名、选择新模型、回归测试、灰度上线与回滚。图:兰塞 AI 编辑部原创。

DeepSeek V4 Pro 正式版更新了什么?

DeepSeek 官方更新日志显示,V4-Pro 正式版于 2026 年 8 月 13 日同步上线 APP、网页端和 API,API 模型名仍为 deepseek-v4-pro。官方同时公布多项 Agent 与代码任务基准结果,并宣布原生支持 Responses API。这里的分数属于厂商在其说明条件下公布的结果,不等同于本站实测,也不能直接推导到你的业务。

本次更新还为 V4-Pro 和 V4-Flash 增加 lowhighmax 三档思考强度。简单任务可从 low 开始,日常 Agent 任务可评估 high,只有在复杂任务确有收益时再使用 max。强度越高通常意味着更长响应时间和更多 Token,应该把质量、成本和延迟放在同一张验收表里。

项目 DeepSeek V4 Pro DeepSeek V4 Flash
API 模型名 deepseek-v4-pro deepseek-v4-flash
当前版本 DeepSeek-V4-Pro-0813 DeepSeek-V4-Flash-0731
上下文 / 最大输出 1M / 384K
思考模式 思考与非思考;支持 low、high、max 强度
接口 Chat Completions、Responses API、Anthropic API
结构化与工具 JSON Output、Tool Calls;FIM 仅非思考模式
官方并发限制 500 2500

模型版本、能力与并发数据复核于 2026 年 8 月 16 日,来源为 DeepSeek 官方“模型与价格”和更新日志。平台配置可能继续变化,生产部署前请重新打开官方页面确认。

2026 年 8 月 17 日后的峰谷价格

DeepSeek 公告显示,新价格于北京时间 2026 年 8 月 17 日 0 时生效。高峰时段为 9:00–12:00、14:00–18:00,其余为闲时。下面均按“每百万 Token”计价:

模型与时段 缓存命中输入 缓存未命中输入 输出
V4-Flash 闲时 0.05 元 1.5 元 4.5 元
V4-Flash 高峰 0.10 元 3.0 元 9.0 元
V4-Pro 闲时 0.15 元 4.5 元 13.5 元
V4-Pro 高峰 0.30 元 9.0 元 27.0 元

对于离线评测、批量摘要、索引构建和非实时 Agent,可以把允许延后的任务排到闲时;在线客服或交互应用则不应为了价格牺牲响应时限。预算模型还要计入重试、工具调用、多轮历史和失败请求,不能只用单次输入长度乘单价。

V4-Pro 和 V4-Flash 怎么选?

  • 优先测试 V4-Flash:常规问答、分类、抽取、摘要、基础 RAG、批量内容处理,以及延迟和并发更重要的任务。
  • 优先测试 V4-Pro:复杂代码仓库修改、需要多步工具调用的 Agent、难度较高的推理和错误代价较大的任务。
  • 采用双模型路由:先由 Flash 处理常规请求;达到复杂度阈值、低置信度、连续失败或人工指定时再切换 Pro。
  • 不要用品牌名当验收:固定提示、输入和评分规则,重复运行并记录成功率、P95 延迟、Token 与人工复核结果。
DeepSeek V4 Flash 与 Pro 按任务复杂度、成本和延迟选型
可先用 Flash 处理常规请求,再把难例、失败重试和高风险任务路由到 Pro。图:兰塞 AI 编辑部原创。

最小迁移步骤

  1. 搜索旧模型名:检查代码、环境变量、容器、CI/CD、数据库、低代码工作流、定时任务和监控告警。
  2. 冻结现状基线:抽取脱敏的真实请求,记录当前成功率、延迟、Token、工具调用和人工复核结果。
  3. 集中模型配置:把模型名放到环境变量或配置中心,不要散落硬编码。
  4. 分开验证模式:非思考、low、high、max 分别测试;工具调用和多轮对话必须覆盖。
  5. 小流量灰度:按用户、任务或请求比例放量,监控错误码、超时、结构化输出失败和成本。
  6. 准备有效回滚:回滚到已验证的新模型配置,不能再把已经停用的旧模型名当作退路。

Python 调用示例

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model=os.getenv("DEEPSEEK_MODEL", "deepseek-v4-flash"),
    messages=[
        {"role": "system", "content": "请给出简洁、可核验的答案。"},
        {"role": "user", "content": "列出 API 灰度上线的三个验收指标。"},
    ],
    extra_body={"thinking": {"type": "enabled"}},
    reasoning_effort="high",
    stream=False,
)

print(response.choices[0].message.content)

生产环境建议通过 DEEPSEEK_MODEL 切换模型。密钥只能保存在服务端环境变量或密钥管理服务中,不要写入前端、公开仓库、截图或日志。不同 SDK 版本对扩展参数的传递方式可能不同,上线前应以官方示例和当前 SDK 文档为准。

Responses API 迁移时要检查什么?

官方更新说明称 V4 Pro 与 V4 Flash 原生支持 OpenAI Responses API 格式。接口兼容不代表业务可以零测试切换:至少需要核对输入消息结构、流式事件、工具调用、错误处理、用量字段和会话状态。如果现有程序依赖 Chat Completions 的特定返回路径,应在适配层统一转换,而不是在业务代码中同时散布两套解析逻辑。

思考模式下还要单独测试多轮与工具调用。不要把思考内容当作稳定业务字段,也不要写入面向用户的审计结论;真正应该保存的是输入版本、模型 ID、工具请求、工具结果、最终回答、错误码和必要的追踪标识。

上线验收表

检查项 通过标准示例 失败动作
任务成功率 固定测试集不低于当前基线 停止放量并定位失败类型
结构化输出 JSON 可解析且字段校验通过 重试受限,失败进入人工队列
工具调用 工具选择、参数和结果回传正确 关闭高风险写入工具
延迟 P95 在业务时限内 降低思考强度或路由 Flash
成本 单任务费用在预算阈值内 限制上下文、重试和输出长度
安全 密钥、隐私和系统提示不进入日志 阻断请求并启动泄露处置
DeepSeek V4 API 灰度上线的质量、延迟、成本、错误和回滚指标
固定测试集和生产灰度应使用同一组核心指标,并在上线前写清回滚阈值。图:兰塞 AI 编辑部原创。

常见问题

base_url 需要修改吗?

使用 OpenAI 兼容格式时仍是 https://api.deepseek.com;Anthropic 兼容格式使用官方列出的 https://api.deepseek.com/anthropic。模型名必须改为当前明确的 V4 名称。

deepseek-chat 和 deepseek-reasoner 还能用吗?

不能再把它们作为可用方案。DeepSeek 官方在 2026 年 4 月的迁移公告中给出三个月过渡期,并明确两者于 7 月 24 日停止访问。应排查所有隐藏配置和备用任务,而不是只修改主服务。

1M 上下文是否意味着可以直接塞入整个知识库?

不建议。上下文容量是上限能力,不是推荐输入长度。检索、去重、权限过滤、引用定位和敏感信息控制仍然必要;过长输入还会增加延迟与费用,并可能稀释真正相关的信息。

本文做过 V4 Pro 与 Flash 的独立跑分吗?

没有。本文只核验官方可用性、模型参数、接口和价格,并提供可复现的业务验收方法。文中提到的厂商基准不标记为本站实测;后续若开展独立测试,会公开测试集、参数、时间和限制。

官方来源与站内延伸

编辑复核与纠错记录

本文由兰塞 AI 编辑流程于 2026 年 8 月 16 日复核。此次更新保留原 URL、发布时间与原创迁移图,删除“V4 Preview”“旧模型即将停用”等过期表述,补充 V4-Pro-0813、V4-Flash-0731、Responses API、思考强度与 8 月 17 日峰谷价格。事实来源均为 DeepSeek 官方文档;本站未把官方基准写成独立实测。本站的来源、更新与纠错原则见关于本站与编辑规范