直接答案:人工智能(Artificial Intelligence,AI)不是某一个聊天机器人,也不等于“让机器像人一样思考”。更可操作的定义是:AI 是一类机器系统,它为明确或隐含的目标,从输入中推断如何生成预测、内容、建议或决策,并影响物理或虚拟环境。不同 AI 系统的自主程度不同,有些部署后还会继续适应。
理解 AI 最重要的不是背模型名,而是看完整系统:谁设定目标、输入来自哪里、模型怎样推断、输出会触发什么动作、错误由谁承担、如何监督和停止。大语言模型、图像生成器、推荐系统、风控模型和自动驾驶感知模块都可以属于 AI,但它们的输入、输出、证据和风险完全不同。

人工智能到底是什么?为什么定义要落到“系统”?
OECD 对 AI 系统定义的解释强调五个要素:机器系统、目标、输入、推断和输出;输出可以是预测、内容、建议或决策,并影响物理或虚拟环境。它还指出 AI 系统在自主性和部署后适应性上存在差异。这个定义比“模仿人类智能”更适合产品、监管和项目验收,因为每一项都可以追问和记录。
欧盟《人工智能法》采用了与 OECD 接近的系统定义,并把“推断”作为区别于只按人工预设规则自动执行的软件的重要特征。欧盟委员会随后发布的AI 系统定义指南进一步说明:判断一个软件是否属于 AI 需要结合系统架构、目标、推断能力和具体使用方式,不能只看营销名称。
| 定义元素 | 需要问的问题 | 例子 | 常见误解 |
|---|---|---|---|
| 目标 | 系统要优化或完成什么?谁设定? | 识别欺诈、生成摘要、推荐内容 | “更智能”本身不是可验收目标 |
| 输入 | 使用哪些数据、提示、规则、传感器或文件? | 交易记录、文本、图像、用户行为 | 只看模型,不看输入质量与权利 |
| 推断 | 系统如何从输入形成输出? | 分类、排序、预测、生成、规划 | 任何自动化都叫 AI |
| 输出 | 结果是什么格式,怎样判对错? | 标签、分数、文本、动作建议 | “回答流畅”就代表正确 |
| 环境 | 输出会影响谁、什么流程或设备? | 网页排序、审批、机器人动作 | 忽略下游动作与累积影响 |
| 监督 | 谁能复核、申诉、停止和回滚? | 人工确认、阈值、审计日志 | 有人工按钮就等于有效监督 |
所以,AI 不必具备意识、情感或人类式理解。一个系统即使只完成狭窄任务,也可能属于 AI;反过来,一个包含大量 if-then 规则的复杂程序,也未必因“很复杂”就属于 AI。定义的用途是帮助识别系统能力与责任,不是判定机器是否“像人”。
AI、机器学习、深度学习、生成式 AI 和大模型是什么关系?
这些词经常被混用,但它们处在不同维度。AI 是最宽的领域;机器学习是构建部分 AI 系统的方法;深度学习是机器学习的一类;生成式 AI 描述输出任务;大模型描述模型规模与通用能力;大语言模型则是以语言及相关多模态任务为核心的一类大模型。

Google Cloud 的 AI、机器学习与深度学习说明把深度学习列为机器学习的特化类型,把机器学习放在更广义的 AI 范围内。其AI 概览也把学习、推理、语言、分析与建议列为常见能力,而不是把 AI 限定为生成文本。
| 术语 | 它描述什么 | 典型例子 | 不等于 |
|---|---|---|---|
| 人工智能 AI | 让机器系统完成推断、预测、生成、决策等任务的广泛领域 | 专家系统、推荐、视觉、机器人、生成模型 | 单一算法或单一 App |
| 机器学习 ML | 从数据或反馈中学习模式的方法集合 | 回归、树模型、聚类、强化学习 | 所有 AI;规则和搜索方法也可用于 AI |
| 深度学习 DL | 使用多层神经网络学习表示的方法 | CNN、Transformer、扩散模型中的神经网络 | 有“深度思考”的机器 |
| 生成式 AI | 生成文本、图像、音频、视频、代码等内容的系统 | 聊天助手、图像生成、代码补全 | 所有 AI,也不自动保证原创或真实 |
| 大模型 | 参数、数据、算力和任务覆盖较大的基础模型 | 语言、多模态、视觉基础模型 | 一定更准、更安全或更适合业务 |
| 大语言模型 LLM | 以语言序列建模为核心,可扩展到工具和多模态 | 问答、摘要、抽取、代码与智能体底座 | 完整产品;搜索、权限和工作流属于系统层 |
如果需要继续理解视觉任务,可以看本站已复核的计算机视觉任务、模型与评测指南;如果关注模型与工具如何形成可持续行动,则看AI 智能体与自动化指南。这两类系统都属于 AI,但输出合同和风险门槛不同。
人工智能系统怎样工作?
AI 系统没有统一工作方式。知识库规则、搜索规划、统计机器学习、深度神经网络和混合系统都可能参与。现代机器学习项目通常经历数据与目标定义、训练或配置、离线评测、部署推断、反馈监控几个阶段;成品生成式 AI 还会叠加检索、工具、权限、内容过滤和界面。
| 阶段 | 发生什么 | 必须留下的证据 | 典型失败 |
|---|---|---|---|
| 定义任务 | 把业务问题改写为可判断的输入、输出与动作 | 成功标准、错误成本、拒绝条件 | 目标含糊,只追求“智能化” |
| 准备输入 | 收集数据、规则、知识或用户上下文 | 来源、授权、代表性、保留期 | 历史偏差、泄露、场景缺失 |
| 训练/配置 | 学习参数,或组合模型、提示、检索和工具 | 版本、参数、依赖、随机性 | 训练与生产条件不一致 |
| 推断 | 新输入经过模型生成分数、内容或动作 | 模型、输入摘要、输出、延迟和费用 | 分布外输入、幻觉、工具错误 |
| 验收 | 按真实任务和场景切片检查质量与风险 | 任务集、评分尺、失败样本、人工改判 | 只看平均准确率或演示样例 |
| 运行与反馈 | 监控漂移、异常、人工修正和下游影响 | 告警、申诉、回滚、再评测记录 | 部署后无人负责,错误持续放大 |
“训练”与“推断”也不能混淆。训练是根据数据或反馈调整模型;推断是已构建系统面对新输入产生输出。很多用户使用聊天助手时并没有训练模型,只是在调用模型推断;把文件放入检索库、保存会话或写提示词,也不必然等于模型参数被训练。
人工智能有哪些类型?
AI 没有唯一分类法。按能力范围可谈专用 AI 与通用 AI;按输出可分预测、生成、推荐、决策和控制;按方法可分知识/规则、搜索规划、机器学习、深度学习和混合系统。分类时必须说明维度,否则“弱 AI、强 AI、生成式 AI”放在同一列表会让读者误以为它们互斥。
| 分类维度 | 类别 | 现实状态或用途 | 判断提示 |
|---|---|---|---|
| 能力范围 | 专用/狭义 AI | 当前绝大多数生产系统,完成有限任务 | 在定义场景外不保证可迁移 |
| 能力范围 | 通用人工智能 AGI | 定义和实现标准仍有争议,不应把营销称谓当既成事实 | 要求公开标准、任务范围与独立证据 |
| 输出任务 | 判别/预测 AI | 分类、评分、风险预测、检测 | 重点看阈值、校准和错误成本 |
| 输出任务 | 生成式 AI | 生成文本、图像、音频、视频和代码 | 重点看事实、权利、可控性与来源 |
| 交互方式 | 推荐/决策系统 | 排序、建议或自动选择动作 | 重点看反馈回路与对人的影响 |
| 载体 | 机器人与具身系统 | 感知、规划并作用于物理环境 | 安全验证和停止机制要求更高 |
不要用“自主”替代具体能力。自主性可以指无需人工逐步确认、能调用工具、能规划多步任务或能控制设备,这些含义不同。系统越接近付款、发送、删除、批准或物理动作,越需要权限隔离、确认点、限额和回滚。
AI 能做什么?怎样把应用描述变成可验收任务?
AI 的应用价值来自具体任务,不来自行业标签。医疗、教育、金融、制造、媒体和公共服务都可能使用 AI,但“用于医疗”不能证明安全有效,“用于教育”也不能证明提升学习。每个应用都要写清输入、输出、使用者、决策位置、错误后果和证据。
| 应用 | AI 输出 | 合格验收 | 不能直接声称 |
|---|---|---|---|
| 客服辅助 | 答案草稿、分类、摘要 | 来源忠实度、解决率、人工修正、敏感信息 | 自动降低多少成本,除非有可复核测试 |
| 文档处理 | 字段、摘要、异常提示 | 字段正确率、漏项、版面切片、追溯 | “读懂所有文档” |
| 推荐与搜索 | 排序、候选、解释 | 相关性、多样性、长期影响、申诉 | 点击更多就一定对用户更好 |
| 视觉质检 | 缺陷类别、位置、置信度 | 缺陷切片、漏检成本、设备延迟、人工复核 | 实验集准确率等于产线效果 |
| 代码辅助 | 代码、测试、解释、补丁 | 可运行测试、安全、依赖和许可证审查 | 生成代码可直接进入生产 |
| 高影响决策 | 风险分数或建议 | 合法性、可解释、偏差、人工责任、申诉 | 模型分数就是客观真相 |
比较成品助手时,可以使用本站的AI 平台同任务评测方法:固定真实任务、条件和评分尺,保存失败样本,再计算人工修正后的合格结果成本。这样比比较厂商口号或单一排行榜更接近真实选择。
AI 应该怎样评测?为什么不能只看一个准确率?
评测必须跟输出合同一致。分类系统可以计算精确率、召回率和 F1;概率预测还要看校准;生成系统要分别评事实、完整性、格式、安全和人工修正;检索增强系统要拆分“是否找到正确证据”和“回答是否忠实使用证据”;智能体还要检查每一步工具调用、权限、状态和停止条件。把所有系统压成一个总分,会掩盖真正决定能否上线的失败。
| 系统类型 | 核心问题 | 至少记录 | 不能被替代 |
|---|---|---|---|
| 分类/检测 | 哪些对象被错分或漏掉? | 混淆矩阵、每类指标、阈值、场景切片 | 只报总体准确率 |
| 概率/风险评分 | 分数是否对应真实概率与行动成本? | 校准、阈值、误报漏报成本、时间漂移 | 只报 AUC |
| 生成式 AI | 结果是否忠实、完整、可用和安全? | 原子主张、来源、格式、人工改判、拒绝 | 只用模型给模型打分 |
| 检索增强 RAG | 是没找到证据,还是生成时歪曲证据? | 检索召回、来源质量、引用支持、无答案处理 | 只看最终答案流畅度 |
| 智能体/自动化 | 多步执行是否可控并达到最终状态? | 计划、工具参数、权限、状态、费用、回滚 | 只看最后一句回复 |
| 高影响系统 | 不同群体和极端场景会受什么影响? | 分组结果、申诉、人工责任、安全与压力测试 | 只在实验室数据上通过 |
评测集要包含高频任务、困难任务、边界任务、必须拒绝任务和历史失败,且不能长期用同一批公开题目代替真实场景。模型、提示、检索库、工具、阈值、设备或业务流程发生变化,都可能改变结果,因此变更后应重跑受影响切片,而不是沿用旧报告。
公开排行榜适合发现候选,不能直接证明你的系统适用。模型可能在通用题库上领先,却在中文术语、企业文档、长尾格式、隐私要求、延迟或单位合格结果成本上落后。本站的模型排行榜原理与偏差指南详细解释了样本、版本、投票偏差和不确定性;真正的采购结论仍要来自自己的固定任务集。
最低评测记录应包含:任务与版本、输入来源、运行条件、原始输出、人工评分理由、失败样本、场景切片、成本与延迟、责任人、通过阈值和回滚条件。没有这些信息,“实测很好”只是无法复核的主张。
AI 有哪些根本局限?
AI 的输出依赖目标、数据、模型、上下文和部署环境。系统可能在测试集表现良好,却在新地区、新设备、新语言或特殊人群上失败;生成模型可能给出语言流畅但证据不足的内容;推荐系统可能因为反馈回路把短期点击放大为长期偏差。
| 局限 | 表现 | 最低防护 |
|---|---|---|
| 数据与分布偏差 | 某些场景、人群、语言或设备错误更高 | 来源审计、分组切片、真实流量监控 |
| 相关不等于因果 | 模型学到表面线索,环境变化后失效 | 反事实检查、干预实验、领域复核 |
| 生成不等于事实 | 虚构来源、数字、功能或关系 | 检索、引用打开、原子主张核验 |
| 指标不等于价值 | 平均分提升但关键失败未改善 | 按错误成本和业务结果定义阈值 |
| 可解释不等于正确 | 系统给出听起来合理的事后说明 | 把解释与真实决策证据分开验证 |
| 自动化会扩大影响 | 错误以更快速度覆盖更多对象 | 限额、人工确认、灰度、熔断和回滚 |
NIST AI 风险管理框架把可信特征放在系统生命周期中处理,强调有效可靠、安全、韧性、透明、可解释、隐私和公平之间可能存在权衡。NIST 的生成式 AI 风险管理配置文件又补充了生成内容、信息完整性、知识产权、隐私、滥用和人机交互等特有风险。它们不是“一次勾完”的认证清单,而是帮助组织持续治理。
怎样判断一个 AI 系统是否可信?
可信不是模型的永久标签,而是“在特定任务、用户、数据和环境下,有足够证据支持使用,并且失败可发现、可接管、可纠正”。NIST AI RMF Core用 Govern、Map、Measure、Manage 四类功能组织风险工作:先建立责任与政策,理解场景和影响,测量风险,再持续处理。
| 可信问题 | 应查看的证据 | 弱证据 |
|---|---|---|
| 它有效吗? | 真实任务集、基线、切片、置信区间、失败样本 | 精选演示或单次成功 |
| 它安全吗? | 威胁模型、越权测试、故障模式、停止和恢复 | 只写“采用行业标准” |
| 它公平吗? | 受影响群体、分组结果、申诉与补救 | 只报告总体平均分 |
| 它透明吗? | 用途、版本、数据边界、限制、责任人和变更记录 | 只公开模型参数量 |
| 它保护隐私吗? | 最小化、合法基础、访问、保留、删除和供应链 | “数据已加密”一句话 |
| 它可控吗? | 权限、阈值、人工确认、日志、限额和回滚演练 | 界面上存在暂停按钮 |
UNESCO《人工智能伦理问题建议书》从人权、环境、多样性、透明、责任与人类监督等方面提出政策框架;OECD AI 原则则强调包容增长、人权、透明、稳健安全和问责。将这些原则落地时,必须转成项目角色、证据、阈值和申诉流程,不能只贴“负责任 AI”标签。
生成式 AI 还需要注意哪些内容、隐私与合规问题?
生成式 AI 会把概率性输出直接呈现为文字、图片、音频、视频或代码,因此用户容易把“形式完整”误认成“事实正确”或“权利清晰”。训练数据、用户输入、检索来源、连接器、输出和下游发布都可能产生不同责任。
面向中国境内公众提供生成式 AI 服务时,可查阅国务院网站公布的《生成式人工智能服务管理暂行办法》及主管部门后续规则。具体义务取决于服务对象、功能、数据、内容和实际运营方式;普通用户使用工具与服务提供者公开运营产品不是同一责任层级。涉及法律判断时应由专业人员结合最新正式文本复核。
- 事实:要求来源、日期和原文支持;高影响结论不得只依赖模型回答。
- 隐私:不要默认“未用于训练”就等于不存储、不审核或不经过第三方。
- 版权与权利:核对输入授权、输出相似性、人物肖像、商标和发布平台规则。
- 安全:外部文档和网页可能包含提示注入;工具调用必须最小权限。
- 责任:明确谁审批、谁能撤回、出错怎样通知和纠正。
一个任务是否真的需要 AI?

- 必要性:规则、搜索、数据库查询或流程改造是否已经能稳定解决?
- 输出合同:输入、输出、错误类型、阈值、拒绝和人工动作能否写清?
- 数据与权利:是否有合法、代表性、可维护的数据和知识来源?
- 评测:是否有真实任务、场景切片、失败成本和非 AI 基线?
- 监督:高影响动作是否有最小权限、人工确认、申诉和停止线?
- 运行:是否能监控漂移、费用、错误和版本,并演练回滚?
| 任务特征 | 优先方案 | 原因 |
|---|---|---|
| 规则清晰、变化少、错误不可接受 | 确定性规则/传统软件 | 更容易证明、测试和审计 |
| 数据中存在复杂模式、输出可量化 | 机器学习候选 | 可用真实样本与基线比较 |
| 非结构化内容需要生成或转换 | 生成式 AI + 验证层 | 覆盖语言和媒体任务,但需控制事实与权利 |
| 敏感数据、低延迟或离线要求高 | 本地/混合架构候选 | 需要按请求数据流和总成本评估 |
| 高影响且无法及时复核 | 暂缓自动化或仅辅助 | 模型错误可能不可逆 |
如果项目涉及本地模型与云端 API 的取舍,可继续查看本地、云端与混合 AI 部署指南。架构选择不应只看模型大小,而要看真实负载、请求级数据流、总拥有成本、运维能力和退出路径。
普通人怎样开始学习人工智能?
学习路径取决于目标。工具使用者应先学任务拆解、来源核验、隐私和输出验收;产品与业务人员要学指标、数据、风险和人机流程;开发者再深入 Python、数据处理、机器学习、模型 API、评测与部署;研究路线则需要数学、优化、概率统计和论文复现。
| 目标 | 第一阶段 | 可交付练习 | 避免 |
|---|---|---|---|
| 日常使用 | 提示、文件、检索、来源与隐私 | 完成一个有引用的研究摘要并逐条复核 | 收藏大量工具却没有固定任务 |
| 产品/运营 | 任务合同、基线、指标、成本、风险 | 写一份含失败样本和回滚条件的试点报告 | 只比较模型排行榜 |
| 应用开发 | Python、API、结构化输出、测试、日志 | 实现一个可复现、有限权限的 AI 功能 | 把密钥写入代码或让模型直接执行高权限动作 |
| 机器学习工程 | 线性代数、概率、监督学习、评测、数据工程 | 用公开数据复现基线并分析错误切片 | 一开始就训练超大模型 |
| 研究 | 数学基础、论文阅读、实验设计、复现 | 公开代码、配置、数据说明与负结果 | 只报告最好一次结果 |
Stanford AI Index 2026可用于了解研究、模型、产业、教育、政策和负责任 AI 的年度证据,但趋势报告不能替代自己的任务学习。更有效的入门方式是选一个真实小问题,建立非 AI 基线,再用 AI 完成、测量、复核和改进一轮。
常见问题
AI 就是 ChatGPT 或大语言模型吗?
不是。大语言模型是 AI 的一个重要分支;推荐系统、视觉检测、语音识别、风控、搜索规划和机器人控制也属于 AI。聊天产品还包含检索、工具、权限、界面和安全策略,不能只用底层模型解释。
AI 会像人一样理解和思考吗?
不能从流畅输出直接推出人类式理解、意识或意图。工程上应观察系统对任务的可验证行为、输入边界和失败模式,不用拟人化描述替代证据。
机器学习一定需要大量数据吗?
不一定。所需数据量取决于任务复杂度、预训练模型、数据质量、迁移方式和允许错误;有时规则、少量高质量标注或预训练模型比堆积低质量数据更有效。
生成式 AI 的回答有引用就可信吗?
不一定。引用可能不支持对应句子、日期过时、主体不一致或只引用二手转述。应把回答拆成原子主张,打开一手来源核对原文、日期和适用范围。
目前已经实现通用人工智能了吗?
AGI 的定义、测试和实现状态仍有争议。模型能在多任务上表现突出,不等于已经满足所有通用智能标准;应要求明确任务范围、独立评测、失败边界和可重复证据。
AI 会取代所有工作吗?
不能从单个模型能力直接推断整个职业消失。工作由多项任务、责任、沟通、现场条件和制度组成。更合理的分析单位是具体任务如何重组、哪些环节自动化、谁复核以及新错误成本。
结论:用系统证据理解 AI,不用拟人化口号
人工智能是一类根据目标和输入进行推断、生成输出并影响环境的机器系统。机器学习和深度学习是重要方法,生成式 AI 是输出能力,大模型是规模与通用性路线;它们相关但不能互换。真正决定 AI 是否有用的,是任务合同、数据与权利、真实评测、错误成本、人工监督和持续运行能力。
最小检查清单:明确目标;写出输入与输出;确认数据来源和权利;建立非 AI 基线;按场景切片评测;打开生成内容的来源;限制权限和自动动作;保留人工确认与申诉;记录模型和配置版本;监控真实失败;准备停止与回滚。
