直接结论:截至 2026 年 9 月 9 日,没有一个被主要研究机构共同采用、并能据此确认“AGI 已经到来”的单一测试。当前系统在编码、推理、视觉和工具调用上进步很快,但“某个榜单超过人类”“某位负责人预测某年实现”都不能单独证明 AGI。判断时必须先说明采用谁的定义,再分别检查能力广度、性能深度、自主性、稳定性和风险。
纠错说明:本页旧版标题把“2026 成为 AGI 奇点之年”和“全球智能即将超过人类总和”写成确定事实。现有公开证据不足以支持这种结论,因此本文撤销旧判断,改为可复核的定义与证据框架。
AGI 到底指什么?
不同机构使用的定义并不相同。OpenAI Charter 把 AGI 描述为“在大多数具有经济价值的工作上超过人类的高度自主系统”;Google DeepMind 的《Levels of AGI》则把性能深度和任务广度分开,并另外讨论自主性与部署风险。两种口径能相互参考,但不能混成一个已经公认的发布日期。
| 口径 | 重点 | 不能据此直接推出 |
|---|---|---|
| OpenAI Charter | 高度自主;覆盖大多数有经济价值的工作 | 某个模型在少数考试领先就等于 AGI |
| DeepMind Levels of AGI | 把广度、性能等级和自主性拆开衡量 | 单个总分就是通用智能的完整证明 |
| 厂商产品发布 | 说明具体模型在特定评测或产品中的能力 | 跨厂商条件完全相同,或已达到统一 AGI 标准 |
| 专家预测 | 表达个人或组织对时间线的判断 | 预测已经成为事实或行业共识 |
判断“达到 AGI”至少要核对什么?
- 先锁定定义:明确讨论的是经济任务、认知任务、物理世界任务,还是某一机构自定等级。
- 检查任务广度:模型是否能在陌生领域迁移,而不是只在训练分布相近的题库取得高分。
- 检查性能深度:不仅看平均分,还要看失败类型、长任务稳定性、事实错误和边界案例。
- 检查自主性:系统能否长期规划、调用工具、发现错误并在权限边界内恢复;人工接管频率是多少。
- 检查可重复性:评测集、模型版本、提示词、工具、采样设置和失败样本是否公开到足以复核。
- 检查部署风险:能力更强不等于可以无监督上线,仍需权限、监控、红队、停止条件和事故响应。
2026 年的模型进展能证明什么?
公开发布说明当前前沿模型在长上下文、代码、视觉、工具使用和长程 Agent 上持续增强;这能证明特定能力边界在推进。它不能自动证明模型可以稳定完成“绝大多数经济工作”,也不能证明不同职业、语言、地区和真实组织环境中的表现已经达到同一水平。
尤其要避免三种推理跳跃:
- 从“某项基准超过人类平均”跳到“所有重要任务都超过人类”;
- 从“能调用工具完成演示”跳到“能长期自主承担责任”;
- 从“厂商预测接近 AGI”跳到“AGI 已有统一验收结论”。
企业和普通用户现在应该怎么做?
采购或部署时,不必等待“AGI”标签。先把真实任务拆成输入、权限、成功条件、失败成本和人工接管点,然后用当前模型做小规模测试。对不可逆操作、资金、隐私、医疗、法律和安全决策保持人工批准。需要建立 Agent 权限边界时,可继续阅读AI Agent 专题和AI 安全与治理指南;了解模型基本结构可查看AI 概念与术语。
一张 AGI 主张核验表
| 看到的说法 | 应追问的证据 | 合格写法 |
|---|---|---|
| “某模型已经达到 AGI” | 采用哪一定义?哪些任务?谁复核? | 按某机构某版本标准,在列明任务中达到某等级 |
| “2026 一定实现 AGI” | 是谁在何时预测?是否附条件和概率? | 某人在某日预测,并明确这不是事实确认 |
| “全面超过人类” | 人类基线、职业范围、语言和失败率是什么? | 仅陈述测试覆盖范围内的比较结果 |
| “能自主工作” | 连续时长、工具权限、成功率和人工接管率是什么? | 描述可复现任务和停止条件 |
常见问题
基准第一能证明达到 AGI 吗?
不能。基准只覆盖有限任务,还可能受到数据污染、提示设置和评分方法影响。AGI 主张需要更广泛、稳定、可复核的证据。
为什么不同机构给出的 AGI 时间不一样?
因为定义、技术假设、风险偏好和预测方法不同。时间预测应保留人物、日期、条件和原始链接,不能写成行业共同结论。
现在的 Agent 算 AGI 吗?
Agent 是系统形态:模型加工具、记忆和流程。它可以提高任务完成度,但是否属于 AGI 仍取决于采用的定义以及跨任务稳定性和自主性证据。
官方与研究资料
- OpenAI Charter:AGI 定义与时间不确定性
- Google DeepMind:Levels of AGI
- Google DeepMind:Taking a responsible path to AGI
- OpenAI Preparedness Framework
- NIST AI Risk Management Framework
资料复核日期:2026 年 9 月 9 日。本文回答的是“如何判断证据”,不预测 AGI 必然到来的年份。