直接答案:GLM-4.7 是 Z.AI 面向编码、推理与智能体任务发布的文本大模型,不是原生视觉模型。想快速接入,应使用官方兼容 OpenAI 风格的 Chat Completions API;只有在数据必须留在自有环境、调用规模足以覆盖 GPU 与运维成本,并且团队具备模型服务能力时,才值得评估开源权重部署。选型时不要只看厂商跑分,应同时核验真实任务正确率、工具调用失败、上下文成本、峰值延迟和人工接管能力。
截至 2026 年 7 月 19 日,Z.AI 的 GLM-4.7 官方型号页列出 GLM-4.7、GLM-4.7-FlashX 与 GLM-4.7-Flash,三者均标注为文本输入、文本输出、200K 上下文。官方开源仓库则列出旗舰权重为 355B-A32B,Flash 为 30B-A3B。API 版、开源版与视觉模型是三件不同的事,不能把名称相近的 GLM-V 能力套在 GLM-4.7 上。

GLM-4.7 到底是什么?什么时候发布?
Z.AI 官方发布记录把 GLM-4.7 的发布日期列为 2025 年 12 月 22 日,重点能力是编码、推理、工具调用和多步骤智能体执行。它不是 2026 年才出现的模型,也不是 GLM-4 系列中所有视觉能力的统称。官方页面展示的前端生成、文档生成和工具使用,仍然建立在文本模型与外部工具协作之上。
| 问题 | 当前可核验答案 | 容易误写的地方 |
|---|---|---|
| 输入/输出模态 | 官方 API 型号页标注 Text → Text | 不能因为能写前端或分析文字化图片结果,就称为原生视觉模型 |
| 上下文 | 官方型号页标注 200K,最大输出 128K | 最大值不是每次都应塞满,也不等于长文档中每个细节都可靠 |
| 旗舰规模 | 开源仓库列出 355B 总参数、32B 激活参数 | MoE 的激活参数不等于权重只占 32B 的存储 |
| 轻量版本 | GLM-4.7-Flash 为 30B-A3B | “轻量”仍需按精度、上下文和并发估算显存 |
| 视觉任务 | 应查看 GLM-V 等视觉语言模型 | 不要把 GLM-4.7 与 GLM-4.6V 混为一个型号 |
如果你只是想理解“基础模型、语言模型和生成式 AI 的关系”,先读站内的基础模型选型指南;本文聚焦 GLM-4.7 的真实接入与工程决策。
GLM-4.7、FlashX、Flash 应该怎么选?
选择型号不能只按“旗舰一定最好”排序。旗舰适合复杂编码、多步骤推理和质量优先任务;FlashX 更适合对延迟和价格敏感、仍需稳定吞吐的线上请求;Flash 在官方定价页当前标为免费,但免费额度、速率和可用性应在调用前重新查看控制台。生产系统应把模型 ID 做成配置,而不是写死在业务代码里。
| 型号 | 更适合 | 重点验证 | 不应直接假设 |
|---|---|---|---|
| GLM-4.7 | 复杂代码修改、工具链、多步骤任务 | 正确率、工具参数、长任务稳定性 | 厂商基准领先就代表你的仓库更好 |
| GLM-4.7-FlashX | 高频文本任务、成本与速度平衡 | 峰值延迟、限流、质量回退 | 轻量版本可无差别替换旗舰 |
| GLM-4.7-Flash | 原型、低风险辅助任务 | 免费政策、配额、可用性和输出质量 | 免费会永久保持或没有速率限制 |
| GLM-V 系列 | 图片、截图、视频等视觉输入 | 支持格式、图像计费、识别边界 | 它与 GLM-4.7 是同一 API 型号 |
GLM-4.7 API 怎么调用?
官方示例向 https://api.z.ai/api/paas/v4/chat/completions 发送 POST 请求,通过 Bearer API Key 鉴权,并把模型 ID 设置为 glm-4.7。密钥只能保存在服务端密钥管理或环境变量中,不能写进浏览器 JavaScript、公开仓库、文章截图或日志。接入前可核对官方 API 入口与鉴权说明。
curl -X POST "https://api.z.ai/api/paas/v4/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $ZAI_API_KEY" \
-d '{
"model": "glm-4.7",
"messages": [
{"role": "system", "content": "只分析给定代码;不执行写入操作。"},
{"role": "user", "content": "找出这个函数的并发风险,并给出最小修改。"}
],
"thinking": {"type": "enabled"},
"max_tokens": 2048,
"temperature": 0.2
}'
这段代码只演示请求结构,没有真实密钥,也没有声称能直接解决所有代码问题。正式接入还应设置连接超时、总超时、重试上限、请求 ID、速率限制、Token 预算和错误分类。对于流式响应,应处理客户端中断与不完整输出;对于工具调用,应先校验工具名称和参数,再由外部执行器决定是否运行。
| 字段 | 用途 | 生产建议 |
|---|---|---|
| model | 选择具体模型 | 配置化,并记录每次请求的实际模型 |
| messages | 系统约束与对话上下文 | 只发送完成任务所需数据,敏感字段先脱敏 |
| thinking | 控制思考模式 | 复杂任务开启,简单分类任务用回归测试决定是否关闭 |
| max_tokens | 限制最大输出 | 按任务设上限,避免异常长输出扩大成本 |
| temperature | 影响输出随机性 | 代码和结构化任务通常从低值验证,不把低温等同于正确 |
思考模式和工具调用如何安全落地?
官方 Thinking Mode 文档区分思考开关及多轮行为。思考模式可能改善复杂任务的分解,但通常会增加延迟和 Token;它也不能替代权限控制。模型生成的工具调用只是候选动作,真正的数据库写入、邮件发送、付款、删除、发布和生产变更必须由外部策略层校验。

| 动作风险 | 例子 | 最低控制 | 失败后处理 |
|---|---|---|---|
| 只读 | 搜索文档、读取允许目录 | 资源白名单、结果长度限制 | 记录错误并返回可解释提示 |
| 可逆写入 | 创建草稿、开测试分支 | 隔离环境、幂等键、自动回滚 | 撤销并保留操作轨迹 |
| 外部影响 | 发邮件、提交工单、公开发布 | 预览、收件人校验、人工确认 | 停止后续动作并通知负责人 |
| 高风险 | 付款、删除、生产配置 | 默认禁止或双人审批、最小权限 | 立即熔断、接管和审计 |
要进一步设计权限、记忆与回滚,可以结合站内的AI 智能体定义与治理指南和异步 API 上线验收示例。
GLM-4.7 API 费用怎么算?
Z.AI 官方定价页按每 100 万 Token 列价。2026 年 7 月 19 日复核时,GLM-4.7 输入为 0.6 美元、缓存输入为 0.11 美元、输出为 2.2 美元;FlashX 输入为 0.07 美元、缓存输入为 0.01 美元、输出为 0.4 美元;Flash 标为免费。价格、免费政策和币种都可能调整,实际结算前必须重新查看官方页面与账户控制台。
估算公式:单次费用 = 输入 Token ÷ 1,000,000 × 输入单价 + 缓存命中 Token ÷ 1,000,000 × 缓存单价 + 输出 Token ÷ 1,000,000 × 输出单价 + 工具费用。月度预算还要乘以请求量、重试率和失败请求比例。不要把“上下文支持 200K”理解为每次都应发送 200K。
| 成本变量 | 如何记录 | 常见浪费 | 优化方式 |
|---|---|---|---|
| 输入 Token | 按请求、任务、租户记录 | 重复发送完整仓库或历史对话 | 检索相关片段、压缩稳定上下文 |
| 缓存命中 | 记录命中量与缓存版本 | 提示词频繁变化导致无法复用 | 把稳定前缀和动态数据分开 |
| 输出 Token | 记录上限和实际用量 | 没有停止条件、重复解释 | 结构化输出、限制长度、分阶段请求 |
| 工具调用 | 记录次数、耗时和第三方费用 | 循环搜索或重复执行 | 调用预算、去重和最大循环次数 |
| 人工复核 | 记录每类任务平均复核时间 | 只算模型费,不算失败返工 | 按单位成功任务计算总成本 |
开源权重能否本地部署?需要多少资源?
可以评估,但“开源”不等于“普通电脑即可运行”。Z.AI 官方开源仓库列出 GLM-4.7 为 355B-A32B BF16、FP8 版本,以及 30B-A3B 的 GLM-4.7-Flash。仓库给出的 vLLM 示例使用张量并行,SGLang 示例也需要多卡配置;具体显存还会受到权重精度、KV Cache、并发、上下文、批处理和服务框架影响。
官方 Hugging Face 模型页提供权重入口,并标注 MIT 许可证;模型配置文件可核验 MoE 层数、专家数量和最大位置等结构信息。但配置文件不是容量承诺:上线前仍需在目标硬件上测量权重加载、KV Cache、首 Token 延迟、生成吞吐、峰值并发和故障恢复。

| 部署层 | 必须回答的问题 | 验收证据 |
|---|---|---|
| 权重与硬件 | BF16/FP8/量化如何选,目标上下文与并发是多少 | 目标机器上的显存峰值和加载时间 |
| 推理服务 | vLLM 或 SGLang,工具解析器和思考解析器如何配置 | 固定版本配置、健康检查与回滚记录 |
| 性能 | 首 Token、输出速度、并发和排队是否满足业务 | 按 P50/P95/P99 分层的压力测试 |
| 质量 | 代码、工具调用和业务答案是否优于当前方案 | 冻结回归集、失败类型与人工评分 |
| 治理 | 数据、日志、依赖许可证和访问权限是否合规 | 数据流图、权限表、依赖清单和审计日志 |
官方跑分应该怎样解读?
官方仓库披露 GLM-4.7 在 SWE-bench、SWE-bench Multilingual、Terminal Bench 2.0、HLE 等基准上的结果。这些数字可用于了解厂商定位,但仍受题集、评分器、代理框架、提示词、工具、采样和运行预算影响。本站没有独立复现实验,因此不会把官方分数写成“我们实测”,也不会据此宣布它比所有闭源模型更适合你的项目。
| 证据层级 | 能说明什么 | 不能说明什么 |
|---|---|---|
| 官方型号与 API 文档 | 当前端点、字段、模态、上下文和型号 | 你的任务一定正确或稳定 |
| 官方基准 | 在披露设置下的相对表现 | 真实仓库、私有数据和生产工具链的效果 |
| 本地回归集 | 目标任务的质量、延迟和失败类型 | 所有行业和未知输入的普遍能力 |
| 灰度生产数据 | 真实流量下的成功率与总成本 | 未覆盖风险和未来版本表现 |
建立回归集时,每个任务至少保存输入、允许工具、预期约束、判定标准、模型版本、提示词版本、实际输出和失败分类。代码任务还要跑测试与静态检查,不能只看答案“像不像”。站内的AI 代码审查工作流可作为相邻实践。
从试用到生产,建议走哪六步?
- 冻结任务:选 30–100 个真实且可判定的任务,覆盖常见、困难和高风险输入。
- 建立基线:记录当前人工流程或现有模型的质量、耗时、成本和失败类型。
- 小流量调用:先用 API 比较 GLM-4.7 与 Flash 系列,不提前购买大规模硬件。
- 加控制层:设置最小权限、工具白名单、幂等、预算、超时、审批和回滚。
- 灰度上线:限制租户、请求量和动作范围,持续采集模型与人工共同结果。
- 再决定自托管:只有当数据边界、规模或长期成本确实支持时,再做目标硬件 PoC。
| 上线门槛 | 通过标准示例 | 未通过时 |
|---|---|---|
| 质量 | 核心任务达到预设正确率,严重错误低于上限 | 缩小任务范围或回退模型 |
| 安全 | 越权测试被策略层阻断,密钥不出服务端 | 停止外部动作,修复权限模型 |
| 可靠性 | 超时、限流、上游失败可重试且不会重复写入 | 补幂等、队列、熔断和人工接管 |
| 成本 | 单位成功任务总成本在预算内 | 缩短上下文、改型号或降低自动化范围 |
| 可追溯 | 请求、版本、工具、审批和结果均可关联 | 补日志后再开放生产流量 |
如果项目仍处于需求阶段,可先用AI 工具选择框架确定是否真的需要模型替换;涉及上线治理时,再结合本文的事实核验流程和AI 版权与许可指南。
怎样建立一套能真正判定好坏的回归集?
模型评测最容易犯的错误,是准备几条“看起来很难”的提示词,然后凭主观印象挑出漂亮答案。可用于上线决策的回归集必须来自真实工作:代码修复应包含可运行测试,检索问答应包含可追溯来源,工具任务应包含允许动作和禁止动作,结构化抽取应有字段级标准答案。每条样本都应注明业务影响,避免一百个低风险格式问题掩盖一个会删除数据的严重错误。
建议把样本分成四层:基础指令遵循、领域正确性、工具与多步骤执行、安全和拒绝。每层同时放入正常输入、模糊输入、缺失信息、冲突约束与恶意输入。对开放式回答,可由两名复核者独立判断“正确、部分正确、错误、不可判定”,分歧样本进入复审;对代码与结构化输出,优先使用单元测试、Schema 校验和静态检查,减少只凭文风评分。
| 样本层 | 代表任务 | 自动证据 | 人工关注 |
|---|---|---|---|
| 指令遵循 | 格式、语言、长度、禁止项 | JSON Schema、正则、长度限制 | 是否遗漏隐含但必要的解释 |
| 领域正确性 | 代码修复、政策问答、数据解释 | 测试、引用存在性、字段对比 | 事实是否被来源支持,边界是否说明 |
| 工具执行 | 搜索、读取、创建草稿、多步骤任务 | 工具轨迹、参数白名单、最终状态 | 计划是否合理,是否产生无谓调用 |
| 安全与拒绝 | 越权、注入、敏感信息、高风险写入 | 策略阻断记录、秘密扫描 | 拒绝是否准确且仍提供安全替代方案 |
比较 GLM-4.7、FlashX、Flash 或其他模型时,必须固定系统提示、工具定义、温度、最大输出、重试规则与评分器版本。每个模型至少重复运行易波动样本,并分别报告首次成功率、重试后成功率、严重错误率、P95 延迟和单位成功任务成本。这样才能避免“便宜模型因为失败重试更多,最终反而更贵”的错觉。
从旧模型迁移到 GLM-4.7 时检查什么?
兼容 OpenAI 风格接口不代表行为完全兼容。迁移前先复制生产提示词与工具定义到隔离环境,检查 system 指令权重、思考字段、流式事件、工具参数、停止原因、Token 统计和错误码。不要直接把旧模型名称替换成 glm-4.7 后全量放量;不同模型可能对同一 JSON Schema、长上下文顺序和多轮工具结果有不同表现。
- 接口层:确认 base URL、鉴权、超时、流式解析和 SDK 版本。
- 提示层:删除只为旧模型设计的冗余提示,保留可验证约束,并给提示词版本号。
- 工具层:核对工具名称、必填字段、枚举、空值和重复调用,所有写入继续由外部权限层控制。
- 数据层:确认发送地区、保留策略、日志脱敏和供应商条款满足组织要求。
- 回退层:保留旧模型路由、人工队列和熔断开关,确保新模型异常时可以快速降级。
常见故障可按四类处理:401/403 先查密钥与权限,429 查配额、并发和退避,5xx 做有上限且带抖动的重试,内容错误则回到提示、检索、工具和回归集定位。任何重试都应带幂等标识;涉及外部写入时,不能因为模型或网络超时就盲目重新执行。
常见问题
GLM-4.7 能直接看图片吗?
官方 GLM-4.7 型号页标注的是文本输入和文本输出。需要直接上传图片或视频时,应核对 GLM-V 系列及其当前 API 文档,不要在 GLM-4.7 请求中猜测图片字段。
200K 上下文是不是可以整仓库直接塞进去?
技术上限不等于推荐用法。整仓库输入会增加成本、延迟和无关信息干扰。更稳妥的方式是先建立代码索引,检索与任务相关的文件和符号,再让模型基于明确边界修改,并用测试验证。
MIT 许可证是否意味着应用可以随便上线?
模型权重许可证解决的是权重使用条件之一。你的训练/输入数据、生成内容、第三方依赖、商标、个人信息、行业监管和部署地区仍有各自要求。上线前应保存许可证版本并完成依赖与数据审查。
GLM-4.7 现在还是最新型号吗?
官方定价和文档导航已经列出更新的 GLM-5 系列,因此 GLM-4.7 不应再描述为“当前最新”。它仍可能因为现有兼容性、开源权重、成本或回归表现而适合特定系统,是否迁移应以真实任务评测决定。
本站是否完成了 API 或本地实测?
没有。本文是依据 2026 年 7 月 19 日可访问的官方文档、官方仓库和官方模型配置完成的中文工程整理。文中的流程图是编辑部原创解释图,不是运行结果;厂商基准也未被本站独立复现。
来源、更新与纠错记录
本次复核使用 Z.AI 官方型号页、发布记录、价格页、思考模式文档、开源仓库与官方 Hugging Face 模型页。对于接口和部署,优先以当前官方型号文档和官方仓库为准。型号、价格、免费额度、推荐框架和参数可能变化,实际接入前请重新核对。
编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 19 日复核。新版修复旧稿整页乱码,撤回“原生多模态视觉”“无幻觉”、无来源百分比、虚构企业案例和伪实测,改为可复核的型号边界、API 调用、成本计算、部署容量与上线验收。本站的来源、更新与纠错原则见关于本站与编辑规范。
