AI概念与词典

什么是人工智能?原理、类型、应用与风险完整指南

人工智能不是单一模型,也不等于像人一样思考。本文用目标、输入、模型、输出、环境和监督解释AI系统,厘清机器学习、深度学习、生成式AI与大模型的关系,并给出应用与风险判断方法。

人工智能系统从目标和输入经过模型推断生成输出并影响环境,同时接受人类监督和反馈的六部分工作链
本页目录
  1. 人工智能到底是什么?为什么定义要落到“系统”?
  2. AI、机器学习、深度学习、生成式 AI 和大模型是什么关系?
  3. 人工智能系统怎样工作?
  4. 人工智能有哪些类型?
  5. AI 能做什么?怎样把应用描述变成可验收任务?
  6. AI 应该怎样评测?为什么不能只看一个准确率?
  7. AI 有哪些根本局限?
  8. 怎样判断一个 AI 系统是否可信?
  9. 生成式 AI 还需要注意哪些内容、隐私与合规问题?
  10. 一个任务是否真的需要 AI?
  11. 普通人怎样开始学习人工智能?
  12. 常见问题
  13. AI 就是 ChatGPT 或大语言模型吗?
  14. AI 会像人一样理解和思考吗?
  15. 机器学习一定需要大量数据吗?
  16. 生成式 AI 的回答有引用就可信吗?
  17. 目前已经实现通用人工智能了吗?
  18. AI 会取代所有工作吗?
  19. 结论:用系统证据理解 AI,不用拟人化口号

直接答案:人工智能(Artificial Intelligence,AI)不是某一个聊天机器人,也不等于“让机器像人一样思考”。更可操作的定义是:AI 是一类机器系统,它为明确或隐含的目标,从输入中推断如何生成预测、内容、建议或决策,并影响物理或虚拟环境。不同 AI 系统的自主程度不同,有些部署后还会继续适应。

理解 AI 最重要的不是背模型名,而是看完整系统:谁设定目标、输入来自哪里、模型怎样推断、输出会触发什么动作、错误由谁承担、如何监督和停止。大语言模型、图像生成器、推荐系统、风控模型和自动驾驶感知模块都可以属于 AI,但它们的输入、输出、证据和风险完全不同。

编辑更正(2026-07-18):旧稿把 AI 简化为“像人一样思考的机器”,又把“提高诊断准确率、提高生产效率”等结果写成普遍事实,没有给出来源、条件或失败边界。新版采用 OECD、EU AI Act 和 NIST 的系统视角,删除效果承诺与“突破性、无限可能”等笼统判断,增加概念关系、系统工作链、应用验收、风险治理和是否真的需要 AI 的决策方法。
人工智能系统从目标和输入经过模型推断生成输出并影响环境,同时接受人类监督和反馈的六部分工作链
AI 不是孤立模型,而是目标、输入、模型、输出、环境与监督共同组成的系统。图:兰塞 AI 编辑部原创。

人工智能到底是什么?为什么定义要落到“系统”?

OECD 对 AI 系统定义的解释强调五个要素:机器系统、目标、输入、推断和输出;输出可以是预测、内容、建议或决策,并影响物理或虚拟环境。它还指出 AI 系统在自主性和部署后适应性上存在差异。这个定义比“模仿人类智能”更适合产品、监管和项目验收,因为每一项都可以追问和记录。

欧盟《人工智能法》采用了与 OECD 接近的系统定义,并把“推断”作为区别于只按人工预设规则自动执行的软件的重要特征。欧盟委员会随后发布的AI 系统定义指南进一步说明:判断一个软件是否属于 AI 需要结合系统架构、目标、推断能力和具体使用方式,不能只看营销名称。

定义元素 需要问的问题 例子 常见误解
目标 系统要优化或完成什么?谁设定? 识别欺诈、生成摘要、推荐内容 “更智能”本身不是可验收目标
输入 使用哪些数据、提示、规则、传感器或文件? 交易记录、文本、图像、用户行为 只看模型,不看输入质量与权利
推断 系统如何从输入形成输出? 分类、排序、预测、生成、规划 任何自动化都叫 AI
输出 结果是什么格式,怎样判对错? 标签、分数、文本、动作建议 “回答流畅”就代表正确
环境 输出会影响谁、什么流程或设备? 网页排序、审批、机器人动作 忽略下游动作与累积影响
监督 谁能复核、申诉、停止和回滚? 人工确认、阈值、审计日志 有人工按钮就等于有效监督

所以,AI 不必具备意识、情感或人类式理解。一个系统即使只完成狭窄任务,也可能属于 AI;反过来,一个包含大量 if-then 规则的复杂程序,也未必因“很复杂”就属于 AI。定义的用途是帮助识别系统能力与责任,不是判定机器是否“像人”。

AI、机器学习、深度学习、生成式 AI 和大模型是什么关系?

这些词经常被混用,但它们处在不同维度。AI 是最宽的领域;机器学习是构建部分 AI 系统的方法;深度学习是机器学习的一类;生成式 AI 描述输出任务;大模型描述模型规模与通用能力;大语言模型则是以语言及相关多模态任务为核心的一类大模型。

人工智能、机器学习、深度学习、生成式AI、大模型和大语言模型按领域、方法、任务与规模拆分的关系图
不要把方法、任务和规模混成一条层级链。现代生成式 AI 多使用深度学习,但“生成式”描述的是输出能力。图:兰塞 AI 编辑部原创。

Google Cloud 的 AI、机器学习与深度学习说明把深度学习列为机器学习的特化类型,把机器学习放在更广义的 AI 范围内。其AI 概览也把学习、推理、语言、分析与建议列为常见能力,而不是把 AI 限定为生成文本。

术语 它描述什么 典型例子 不等于
人工智能 AI 让机器系统完成推断、预测、生成、决策等任务的广泛领域 专家系统、推荐、视觉、机器人、生成模型 单一算法或单一 App
机器学习 ML 从数据或反馈中学习模式的方法集合 回归、树模型、聚类、强化学习 所有 AI;规则和搜索方法也可用于 AI
深度学习 DL 使用多层神经网络学习表示的方法 CNN、Transformer、扩散模型中的神经网络 有“深度思考”的机器
生成式 AI 生成文本、图像、音频、视频、代码等内容的系统 聊天助手、图像生成、代码补全 所有 AI,也不自动保证原创或真实
大模型 参数、数据、算力和任务覆盖较大的基础模型 语言、多模态、视觉基础模型 一定更准、更安全或更适合业务
大语言模型 LLM 以语言序列建模为核心,可扩展到工具和多模态 问答、摘要、抽取、代码与智能体底座 完整产品;搜索、权限和工作流属于系统层

如果需要继续理解视觉任务,可以看本站已复核的计算机视觉任务、模型与评测指南;如果关注模型与工具如何形成可持续行动,则看AI 智能体与自动化指南。这两类系统都属于 AI,但输出合同和风险门槛不同。

人工智能系统怎样工作?

AI 系统没有统一工作方式。知识库规则、搜索规划、统计机器学习、深度神经网络和混合系统都可能参与。现代机器学习项目通常经历数据与目标定义、训练或配置、离线评测、部署推断、反馈监控几个阶段;成品生成式 AI 还会叠加检索、工具、权限、内容过滤和界面。

阶段 发生什么 必须留下的证据 典型失败
定义任务 把业务问题改写为可判断的输入、输出与动作 成功标准、错误成本、拒绝条件 目标含糊,只追求“智能化”
准备输入 收集数据、规则、知识或用户上下文 来源、授权、代表性、保留期 历史偏差、泄露、场景缺失
训练/配置 学习参数,或组合模型、提示、检索和工具 版本、参数、依赖、随机性 训练与生产条件不一致
推断 新输入经过模型生成分数、内容或动作 模型、输入摘要、输出、延迟和费用 分布外输入、幻觉、工具错误
验收 按真实任务和场景切片检查质量与风险 任务集、评分尺、失败样本、人工改判 只看平均准确率或演示样例
运行与反馈 监控漂移、异常、人工修正和下游影响 告警、申诉、回滚、再评测记录 部署后无人负责,错误持续放大

“训练”与“推断”也不能混淆。训练是根据数据或反馈调整模型;推断是已构建系统面对新输入产生输出。很多用户使用聊天助手时并没有训练模型,只是在调用模型推断;把文件放入检索库、保存会话或写提示词,也不必然等于模型参数被训练。

人工智能有哪些类型?

AI 没有唯一分类法。按能力范围可谈专用 AI 与通用 AI;按输出可分预测、生成、推荐、决策和控制;按方法可分知识/规则、搜索规划、机器学习、深度学习和混合系统。分类时必须说明维度,否则“弱 AI、强 AI、生成式 AI”放在同一列表会让读者误以为它们互斥。

分类维度 类别 现实状态或用途 判断提示
能力范围 专用/狭义 AI 当前绝大多数生产系统,完成有限任务 在定义场景外不保证可迁移
能力范围 通用人工智能 AGI 定义和实现标准仍有争议,不应把营销称谓当既成事实 要求公开标准、任务范围与独立证据
输出任务 判别/预测 AI 分类、评分、风险预测、检测 重点看阈值、校准和错误成本
输出任务 生成式 AI 生成文本、图像、音频、视频和代码 重点看事实、权利、可控性与来源
交互方式 推荐/决策系统 排序、建议或自动选择动作 重点看反馈回路与对人的影响
载体 机器人与具身系统 感知、规划并作用于物理环境 安全验证和停止机制要求更高

不要用“自主”替代具体能力。自主性可以指无需人工逐步确认、能调用工具、能规划多步任务或能控制设备,这些含义不同。系统越接近付款、发送、删除、批准或物理动作,越需要权限隔离、确认点、限额和回滚。

AI 能做什么?怎样把应用描述变成可验收任务?

AI 的应用价值来自具体任务,不来自行业标签。医疗、教育、金融、制造、媒体和公共服务都可能使用 AI,但“用于医疗”不能证明安全有效,“用于教育”也不能证明提升学习。每个应用都要写清输入、输出、使用者、决策位置、错误后果和证据。

应用 AI 输出 合格验收 不能直接声称
客服辅助 答案草稿、分类、摘要 来源忠实度、解决率、人工修正、敏感信息 自动降低多少成本,除非有可复核测试
文档处理 字段、摘要、异常提示 字段正确率、漏项、版面切片、追溯 “读懂所有文档”
推荐与搜索 排序、候选、解释 相关性、多样性、长期影响、申诉 点击更多就一定对用户更好
视觉质检 缺陷类别、位置、置信度 缺陷切片、漏检成本、设备延迟、人工复核 实验集准确率等于产线效果
代码辅助 代码、测试、解释、补丁 可运行测试、安全、依赖和许可证审查 生成代码可直接进入生产
高影响决策 风险分数或建议 合法性、可解释、偏差、人工责任、申诉 模型分数就是客观真相

比较成品助手时,可以使用本站的AI 平台同任务评测方法:固定真实任务、条件和评分尺,保存失败样本,再计算人工修正后的合格结果成本。这样比比较厂商口号或单一排行榜更接近真实选择。

AI 应该怎样评测?为什么不能只看一个准确率?

评测必须跟输出合同一致。分类系统可以计算精确率、召回率和 F1;概率预测还要看校准;生成系统要分别评事实、完整性、格式、安全和人工修正;检索增强系统要拆分“是否找到正确证据”和“回答是否忠实使用证据”;智能体还要检查每一步工具调用、权限、状态和停止条件。把所有系统压成一个总分,会掩盖真正决定能否上线的失败。

系统类型 核心问题 至少记录 不能被替代
分类/检测 哪些对象被错分或漏掉? 混淆矩阵、每类指标、阈值、场景切片 只报总体准确率
概率/风险评分 分数是否对应真实概率与行动成本? 校准、阈值、误报漏报成本、时间漂移 只报 AUC
生成式 AI 结果是否忠实、完整、可用和安全? 原子主张、来源、格式、人工改判、拒绝 只用模型给模型打分
检索增强 RAG 是没找到证据,还是生成时歪曲证据? 检索召回、来源质量、引用支持、无答案处理 只看最终答案流畅度
智能体/自动化 多步执行是否可控并达到最终状态? 计划、工具参数、权限、状态、费用、回滚 只看最后一句回复
高影响系统 不同群体和极端场景会受什么影响? 分组结果、申诉、人工责任、安全与压力测试 只在实验室数据上通过

评测集要包含高频任务、困难任务、边界任务、必须拒绝任务和历史失败,且不能长期用同一批公开题目代替真实场景。模型、提示、检索库、工具、阈值、设备或业务流程发生变化,都可能改变结果,因此变更后应重跑受影响切片,而不是沿用旧报告。

公开排行榜适合发现候选,不能直接证明你的系统适用。模型可能在通用题库上领先,却在中文术语、企业文档、长尾格式、隐私要求、延迟或单位合格结果成本上落后。本站的模型排行榜原理与偏差指南详细解释了样本、版本、投票偏差和不确定性;真正的采购结论仍要来自自己的固定任务集。

最低评测记录应包含:任务与版本、输入来源、运行条件、原始输出、人工评分理由、失败样本、场景切片、成本与延迟、责任人、通过阈值和回滚条件。没有这些信息,“实测很好”只是无法复核的主张。

AI 有哪些根本局限?

AI 的输出依赖目标、数据、模型、上下文和部署环境。系统可能在测试集表现良好,却在新地区、新设备、新语言或特殊人群上失败;生成模型可能给出语言流畅但证据不足的内容;推荐系统可能因为反馈回路把短期点击放大为长期偏差。

局限 表现 最低防护
数据与分布偏差 某些场景、人群、语言或设备错误更高 来源审计、分组切片、真实流量监控
相关不等于因果 模型学到表面线索,环境变化后失效 反事实检查、干预实验、领域复核
生成不等于事实 虚构来源、数字、功能或关系 检索、引用打开、原子主张核验
指标不等于价值 平均分提升但关键失败未改善 按错误成本和业务结果定义阈值
可解释不等于正确 系统给出听起来合理的事后说明 把解释与真实决策证据分开验证
自动化会扩大影响 错误以更快速度覆盖更多对象 限额、人工确认、灰度、熔断和回滚

NIST AI 风险管理框架把可信特征放在系统生命周期中处理,强调有效可靠、安全、韧性、透明、可解释、隐私和公平之间可能存在权衡。NIST 的生成式 AI 风险管理配置文件又补充了生成内容、信息完整性、知识产权、隐私、滥用和人机交互等特有风险。它们不是“一次勾完”的认证清单,而是帮助组织持续治理。

怎样判断一个 AI 系统是否可信?

可信不是模型的永久标签,而是“在特定任务、用户、数据和环境下,有足够证据支持使用,并且失败可发现、可接管、可纠正”。NIST AI RMF Core用 Govern、Map、Measure、Manage 四类功能组织风险工作:先建立责任与政策,理解场景和影响,测量风险,再持续处理。

可信问题 应查看的证据 弱证据
它有效吗? 真实任务集、基线、切片、置信区间、失败样本 精选演示或单次成功
它安全吗? 威胁模型、越权测试、故障模式、停止和恢复 只写“采用行业标准”
它公平吗? 受影响群体、分组结果、申诉与补救 只报告总体平均分
它透明吗? 用途、版本、数据边界、限制、责任人和变更记录 只公开模型参数量
它保护隐私吗? 最小化、合法基础、访问、保留、删除和供应链 “数据已加密”一句话
它可控吗? 权限、阈值、人工确认、日志、限额和回滚演练 界面上存在暂停按钮

UNESCO《人工智能伦理问题建议书》从人权、环境、多样性、透明、责任与人类监督等方面提出政策框架;OECD AI 原则则强调包容增长、人权、透明、稳健安全和问责。将这些原则落地时,必须转成项目角色、证据、阈值和申诉流程,不能只贴“负责任 AI”标签。

生成式 AI 还需要注意哪些内容、隐私与合规问题?

生成式 AI 会把概率性输出直接呈现为文字、图片、音频、视频或代码,因此用户容易把“形式完整”误认成“事实正确”或“权利清晰”。训练数据、用户输入、检索来源、连接器、输出和下游发布都可能产生不同责任。

面向中国境内公众提供生成式 AI 服务时,可查阅国务院网站公布的《生成式人工智能服务管理暂行办法》及主管部门后续规则。具体义务取决于服务对象、功能、数据、内容和实际运营方式;普通用户使用工具与服务提供者公开运营产品不是同一责任层级。涉及法律判断时应由专业人员结合最新正式文本复核。

  • 事实:要求来源、日期和原文支持;高影响结论不得只依赖模型回答。
  • 隐私:不要默认“未用于训练”就等于不存储、不审核或不经过第三方。
  • 版权与权利:核对输入授权、输出相似性、人物肖像、商标和发布平台规则。
  • 安全:外部文档和网页可能包含提示注入;工具调用必须最小权限。
  • 责任:明确谁审批、谁能撤回、出错怎样通知和纠正。

一个任务是否真的需要 AI?

AI项目上线前依次通过必要性、输出合同、数据权利、切片评测、人工监督和监控回滚六道决策门
能调用模型不等于应该上线;任何一道关键门失败,都应缩小范围、改用规则或保留人工流程。图:兰塞 AI 编辑部原创。
  1. 必要性:规则、搜索、数据库查询或流程改造是否已经能稳定解决?
  2. 输出合同:输入、输出、错误类型、阈值、拒绝和人工动作能否写清?
  3. 数据与权利:是否有合法、代表性、可维护的数据和知识来源?
  4. 评测:是否有真实任务、场景切片、失败成本和非 AI 基线?
  5. 监督:高影响动作是否有最小权限、人工确认、申诉和停止线?
  6. 运行:是否能监控漂移、费用、错误和版本,并演练回滚?
任务特征 优先方案 原因
规则清晰、变化少、错误不可接受 确定性规则/传统软件 更容易证明、测试和审计
数据中存在复杂模式、输出可量化 机器学习候选 可用真实样本与基线比较
非结构化内容需要生成或转换 生成式 AI + 验证层 覆盖语言和媒体任务,但需控制事实与权利
敏感数据、低延迟或离线要求高 本地/混合架构候选 需要按请求数据流和总成本评估
高影响且无法及时复核 暂缓自动化或仅辅助 模型错误可能不可逆

如果项目涉及本地模型与云端 API 的取舍,可继续查看本地、云端与混合 AI 部署指南。架构选择不应只看模型大小,而要看真实负载、请求级数据流、总拥有成本、运维能力和退出路径。

普通人怎样开始学习人工智能?

学习路径取决于目标。工具使用者应先学任务拆解、来源核验、隐私和输出验收;产品与业务人员要学指标、数据、风险和人机流程;开发者再深入 Python、数据处理、机器学习、模型 API、评测与部署;研究路线则需要数学、优化、概率统计和论文复现。

目标 第一阶段 可交付练习 避免
日常使用 提示、文件、检索、来源与隐私 完成一个有引用的研究摘要并逐条复核 收藏大量工具却没有固定任务
产品/运营 任务合同、基线、指标、成本、风险 写一份含失败样本和回滚条件的试点报告 只比较模型排行榜
应用开发 Python、API、结构化输出、测试、日志 实现一个可复现、有限权限的 AI 功能 把密钥写入代码或让模型直接执行高权限动作
机器学习工程 线性代数、概率、监督学习、评测、数据工程 用公开数据复现基线并分析错误切片 一开始就训练超大模型
研究 数学基础、论文阅读、实验设计、复现 公开代码、配置、数据说明与负结果 只报告最好一次结果

Stanford AI Index 2026可用于了解研究、模型、产业、教育、政策和负责任 AI 的年度证据,但趋势报告不能替代自己的任务学习。更有效的入门方式是选一个真实小问题,建立非 AI 基线,再用 AI 完成、测量、复核和改进一轮。

常见问题

AI 就是 ChatGPT 或大语言模型吗?

不是。大语言模型是 AI 的一个重要分支;推荐系统、视觉检测、语音识别、风控、搜索规划和机器人控制也属于 AI。聊天产品还包含检索、工具、权限、界面和安全策略,不能只用底层模型解释。

AI 会像人一样理解和思考吗?

不能从流畅输出直接推出人类式理解、意识或意图。工程上应观察系统对任务的可验证行为、输入边界和失败模式,不用拟人化描述替代证据。

机器学习一定需要大量数据吗?

不一定。所需数据量取决于任务复杂度、预训练模型、数据质量、迁移方式和允许错误;有时规则、少量高质量标注或预训练模型比堆积低质量数据更有效。

生成式 AI 的回答有引用就可信吗?

不一定。引用可能不支持对应句子、日期过时、主体不一致或只引用二手转述。应把回答拆成原子主张,打开一手来源核对原文、日期和适用范围。

目前已经实现通用人工智能了吗?

AGI 的定义、测试和实现状态仍有争议。模型能在多任务上表现突出,不等于已经满足所有通用智能标准;应要求明确任务范围、独立评测、失败边界和可重复证据。

AI 会取代所有工作吗?

不能从单个模型能力直接推断整个职业消失。工作由多项任务、责任、沟通、现场条件和制度组成。更合理的分析单位是具体任务如何重组、哪些环节自动化、谁复核以及新错误成本。

结论:用系统证据理解 AI,不用拟人化口号

人工智能是一类根据目标和输入进行推断、生成输出并影响环境的机器系统。机器学习和深度学习是重要方法,生成式 AI 是输出能力,大模型是规模与通用性路线;它们相关但不能互换。真正决定 AI 是否有用的,是任务合同、数据与权利、真实评测、错误成本、人工监督和持续运行能力。

最小检查清单:明确目标;写出输入与输出;确认数据来源和权利;建立非 AI 基线;按场景切片评测;打开生成内容的来源;限制权限和自动动作;保留人工确认与申诉;记录模型和配置版本;监控真实失败;准备停止与回滚。

编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 18 日重建。旧稿“像人一样思考”的单一拟人化定义、无条件效果承诺和以获取搜索精选片段为目标的表述已删除;新版依据 OECD、EU AI Act、NIST、UNESCO、Stanford HAI、中国政府正式文本与官方技术资料,增加系统定义、概念关系、工作链、应用验收、风险治理和决策门。本站责任主体与纠错原则见关于本站