Ch1-2 绪论与智能体 (Introduction & Intelligent Agents)

课件:lec1_intro.pdf (62 页) + lec2.pdf (45 页)
教材:Artificial Intelligence: A Modern Approach (Russell & Norvig), Ch1 & Ch2
教师:吉建民,USTC


0. 本章概述

本章是整门课的起点,由"绪论"与"智能体"两节合并。绪论回答"AI 是什么、从哪来、到哪去";智能体给出贯穿全书的统一框架——理性智能体 (Rational Agent)。后续所有主题(搜索、逻辑、不确定性、学习)都可视为不同类型智能体的能力。

子主题 核心内容 重要程度
AI 的四种定义思路 像人行动/像人思考/理性思考/理性行动;图灵测试 ⭐⭐⭐
理性智能体框架 agent = architecture + program;f: P*→A ⭐⭐⭐
机器学习为何可能 PAC 学习、Hoeffding 不等式、奥卡姆剃刀 ⭐⭐⭐
理性 (Rationality) 性能度量;理性 ≠ 全知 ≠ 必然成功 ⭐⭐⭐
PEAS 描述 Performance / Environment / Actuators / Sensors ⭐⭐⭐
环境类型(6 维度) 可观测性/确定性/片段性/静态/离散/单多智能体 ⭐⭐⭐
智能体类型 反射 / 有状态 / 目标驱动 / 效用驱动 / 学习 ⭐⭐⭐
Agentic AI(现代) ReAct 范式、OpenClaw、LLM 驱动的智能体 ⭐⭐
AI 发展简史与现状 达特茅斯会议、两次寒冬、深度学习、大模型、具身智能 ⭐⭐

第一部分:人工智能绪论 (lec1)

1.1 课程概览

教材与考核

  • 主教材Artificial Intelligence: A Modern Approach (3rd Edition),S. Russell & P. Norvig(中译《人工智能——一种现代方法》)
  • 参考书:机器学习(周志华,2016)、《动手学深度学习》(第二版)
  • 学期总评 = 期末考试 (60%) + 书面作业 (15%) + 实验部分 (25%)

课程六大模块

部分 主题 教材章节
人工智能概述 / Introduction and Agents Ch 1, 2
问题求解 / Search(搜索、有信息搜索、CSP、博弈规划) Ch 3–6
知识、推理与规划 / Logic, Knowledge, Reasoning, Planning Ch 7–12
不确定知识与推理 / Uncertainty and Decision Making(贝叶斯网、MDP、POMDP、随机博弈) Ch 13–17
学习 / Learning(ML、DL、RL) Ch 18–21
应用 / NLP, Perception, Robotics Ch 22–25

课程定位

  • 广义"人工智能"含搜索、知识表示与推理、规划、MDP、贝叶斯网等经典工作;当下大众语境中的"AI"多指机器学习/深度学习/大模型。
  • 本课定位:面向计算机专业,熟练掌握 IT 工程师应具备的 AI 基础技术;同时作为索引介绍 ML/NN/大模型等新方向,仅要求了解
  • 进阶建议:系统入门 DL → 自学"动手学深度学习"(李沐,d2l.ai);精深 → 选定 CV/NLP/多模态等具体领域,从综述读起、动手实现;成专家 → 加入实验室做前沿研究。

1.2 什么是 AI?—— 四种定义思路

教材主张:“理性地行动 (acting rationally)”

四种思路的二维划分(按"像人/理性" × “思考/行动”):

像人 (Humanly) 理性 (Rationally)
思考 认知科学 (Cognitive Science) 思维法则 (Laws of Thought)
行动 图灵测试 (Turing Test) 理性智能体 (Rational Agent) ✅

① 像人一样行动 (Acting Humanly):图灵测试

  • Turing (1950) “Computing Machinery and Intelligence”:将"机器能否思考?“转化为"机器能否表现出智能行为?”
  • 模仿游戏 (Imitation Game):人类裁判通过问答区分机器与真人。
  • 预言:到 2000 年,机器可能有 30% 概率骗过普通人 5 分钟;并预见了此后 50 年反对 AI 的主要论点。
  • 暗示 AI 的核心组成部分:知识 (knowledge)、推理 (reasoning)、语言理解 (language understanding)、学习 (learning)
  • ⚠️ 缺点:不可复现、非构造性、难以做数学分析。

② 像人一样思考 (Thinking Humanly):认知科学

  • 1960s"认知革命":信息加工心理学取代行为主义。
  • 需要关于大脑内部活动的科学理论,涉及抽象层次(“知识"还是"电路”?)与验证方式(自上而下预测行为 / 自下而上神经数据)。
  • 现已与 AI 分离:发展为认知科学 (Cognitive Science) 与认知神经科学 (Cognitive Neuroscience)。

③ 理性地思考 (Thinking Rationally):思维法则

  • 规范性 (normative / prescriptive) 而非描述性。
  • 源于亚里士多德:什么是正确的论证/思维过程?古希腊各学派发展出各种逻辑(思想的符号化与推导规则)。
  • 经数学、哲学一脉相承到现代 AI。
  • ⚠️ 问题:
    • 并非所有智能行为都由逻辑深思熟虑驱动;
    • "思考的目的是什么?该有什么想法?"难以回答;
    • 逻辑系统在不确定性下常做错事(部分学者认同此点,部分不认同)。

④ 理性地行动 (Acting Rationally) ← 教材采用

  • 理性行为 (rational behavior) = 做正确的事:在给定可得信息下,期望最大化目标达成。
  • 不一定需要思考(如眨眼反射);但思考应服务于理性行动。
  • 引亚里士多德《尼各马可伦理学》(Nicomachean Ethics):“一切技艺与探索、一切行动与追求,都被认为指向某种善。”
  • 关键区分:
    • 理性 ≠ 成功 (rational ≠ successful)
    • 不理性 ≠ 疯狂 (irrationality = 次优行动,而非 insane)
    • 完全依赖目标 (goals)
    • 现实世界充满不确定性与复杂性,通常只是近似理性

1.3 理性智能体 (Rational Agents)

⭐ 这是贯穿全书的统一定义:

  • 智能体 (agent) 是能够感知 (perceive)行动 (act) 的实体。
  • 本课核心:设计理性智能体
  • 抽象地,智能体是一个从感知历史到行动的函数:

f:PAf : P^{*} \to A

PP^{*} 为所有可能的感知序列,AA 为动作集)

  • 对给定环境类与任务类,寻找性能最优的智能体(类)。
  • ⚠️ 注意:计算资源有限使完美理性不可达 → 实际目标是"为给定机器资源设计最好的程序"。

学习与具身案例:自动驾驶架构在 2020 年前后从"分模块流水线"转向"端到端"。


1.4 机器学习:表示 + 评价 + 优化

  • 机器学习 ≈ 拟合一个函数
  • 学习 = 表示 + 评价 + 优化
    • 表示 (Representation):确定假设空间 (hypothesis space) H\mathcal{H}
    • 评价 (Evaluation):用评价函数(目标函数/打分函数)判断优劣。
    • 优化 (Optimization):用搜索方法在假设空间中找到评价函数得分最高的函数。

1.4.1 误差定义

设假设 hHh \in \mathcal{H},目标概念 cCc \in \mathcal{C},分布 D\mathcal{D},样本集 S=(x1,,xm)S=(x_1,\dots,x_m)

  • 泛化误差 (generalization error)

R(h)=PrxD[h(x)c(x)]R(h) = \Pr_{x \sim \mathcal{D}}[h(x) \neq c(x)]

  • 经验误差 (empirical error)

R^S(h)=1mi=1m1[h(xi)c(xi)]\hat{R}_S(h) = \frac{1}{m}\sum_{i=1}^{m}\mathbb{1}[h(x_i) \neq c(x_i)]

  • 两者关系:因为 SSD\mathcal{D} 独立同分布产生,

ESDm[R^S(h)]=R(h)\mathbb{E}_{S\sim\mathcal{D}^m}\big[\hat{R}_S(h)\big] = R(h)

(经验误差是泛化误差的无偏估计)

1.4.2 PAC 学习(“机器学习为什么可能”)

"好的假设"需同时满足两个 PAC 辨识条件

  1. 近似正确 (Approximately Correct):泛化误差足够小,即 R(h)ϵR(h) \le \epsilon
  2. 可能正确 (Probably Correct):以大概率近似正确,即 P(R(h)ϵ)1δP(R(h)\le\epsilon)\ge 1-\delta

且所需样本数是关于 1/ϵ,1/δ,n,size(c)1/\epsilon,\,1/\delta,\,n,\,\text{size}(c)多项式函数

PAC 可学 (PAC-Learnable) 定义:概念类 C\mathcal{C} 称为 PAC 可学,若存在算法 AA 和多项式 poly()\text{poly}(\cdot),使得对任意 ϵ>0,δ>0\epsilon>0,\delta>0、任意分布 D\mathcal{D}(实例长度 nn)、任意目标概念 cCc\in\mathcal{C},当样本量

mpoly ⁣(1/ϵ,1/δ,n,size(c))m \ge \text{poly}\!\left(1/\epsilon,\,1/\delta,\,n,\,\text{size}(c)\right)

PSDm ⁣[R(hS)ϵ]1δP_{S\sim\mathcal{D}^m}\!\left[R(h_S)\le\epsilon\right]\ge 1-\delta。若 AA 运行时间也是多项式,则称高效 PAC 可学AAC\mathcal{C} 的 PAC 学习算法。

1.4.3 独立同分布 (i.i.d.)

X1,,XnX_1,\dots,X_n 独立同分布当且仅当:

  • 独立性:任意有限个 Xi1,,XikX_{i_1},\dots,X_{i_k} 的联合分布 = 各自边缘分布之积;即每个变量的取值不受其他变量影响。
  • 同分布性:所有变量服从相同分布。

⚠️ i.i.d. 是理想化假设,实际数据常违反(如时间序列自相关、空间聚类效应),需用时序分析、混合模型,或数据预处理(随机打乱)逼近。

1.4.4 Hoeffding 不等式

定理(Wassily Hoeffding, 1963):设 X1,,XmX_1,\dots,X_m i.i.d.,Xi[ai,bi]X_i\in[a_i,b_i],对任意 ϵ>0\epsilon>0

P ⁣(1mi=1mXi1mi=1mE(Xi)ϵ)2exp ⁣(2m2ϵ2i=1m(biai)2)P\!\left(\frac{1}{m}\sum_{i=1}^{m}X_i - \frac{1}{m}\sum_{i=1}^{m}\mathbb{E}(X_i) \ge \epsilon\right) \le 2\exp\!\left(\frac{-2m^2\epsilon^2}{\sum_{i=1}^{m}(b_i-a_i)^2}\right)

  • 直觉:取值范围有界的独立变量,随样本量增加,其均值越来越集中于期望附近;上界随 mm 指数级下降
  • 特例 Xi[0,1]X_i\in[0,1]P()2e2mϵ2P(\cdot)\le 2e^{-2m\epsilon^2}

1.4.5 经验误差与泛化误差的关系

E(R^S(h))=R(h)\mathbb{E}(\hat{R}_S(h))=R(h) 代入 Hoeffding([0,1][0,1] 情形):

PSDm ⁣[R^S(h)R(h)ϵ]2e2mϵ2P_{S\sim\mathcal{D}^m}\!\left[\hat{R}_S(h)-R(h)\ge\epsilon\right]\le 2e^{-2m\epsilon^2}

δ=2e2mϵ2\delta = 2e^{-2m\epsilon^2},则对固定假设 h:X{0,1}h:\mathcal{X}\to\{0,1\}以至少 1δ1-\delta 的概率成立:

R(h)R^S(h)+log(2/δ)2m\boxed{\,R(h)\le \hat{R}_S(h) + \sqrt{\dfrac{\log(2/\delta)}{2m}}\,}

1.4.6 奥卡姆剃刀 (Occam’s Razor)

有限假设集 H\mathcal{H}

R(h)R^S(h)+O ⁣(log2Hm)R(h) \le \hat{R}_S(h) + O\!\left(\sqrt{\dfrac{\log_2|\mathcal{H}|}{m}}\right)

  • 固定 H|\mathcal{H}| 时,要达到与一致情形相同的保证,需要平方量级更大的标注样本。
  • Occam’s Razor(奥卡姆剃刀):“如无必要,勿增实体” / 最简单的解释最好

1.4.7 从特征工程到深度学习

  • 传统 ML 流程中"特征表达"靠人工提取,耗时且关键 → 能否自动学习特征?能,即深度学习 (Deep Learning / 无监督特征学习)
  • 衍生:深度神经网络、计算图、CNN;代表模型 BERT、GPT-3。
  • DeepSeek(范例):
    • V3:671B 参数、推理激活 37B;核心创新含 MoE 架构(对 Transformer 的改进)、数据并行-专家并行-流水并行、MTP、分布式混合精度训练、DualPipe 训练框架;大幅降低训练/推理成本。
    • R1:用强化学习 GRPO(多组策略竞争、组内相对奖励)优化生成更好的 CoT,提升 LLM 推理能力;R1 生成的带推理过程 CoT 数据可蒸馏小模型,显著提升其推理能力。

1.5 "新"新工具 (Novum Organum):神经网络的认识论

借"自然科学如何可能?"这一哲学命题,引出神经网络作为新工具的地位。

  • 英国经验主义(休谟):没有绝对真理,只是经验的归纳整理、compact 的表示。
  • 大陆理性主义(莱布尼茨):仿《几何原本》,从几条公设出发形式化推理构建完整理论。
    • 哥德尔不完备性定理:任何足够复杂(含数学归纳法)的公理系统不能既可靠又完备;可靠系统中必有真但不可证的命题。
    • 不同公理系统(理论)彼此不能证伪。
  • 康德、黑格尔:人通过先验概念理解世界——不是世界本就如此,而是我们只能以公理系统方式理解复杂世界。
  • 培根《新工具》公理系统 + 科学实验
  • "新"新工具 = 神经网络、端到端学习,其理论基础有二:
    • 通用近似 (Universal Approximation):任何连续函数都能被前馈神经网络以任意小误差近似。
    • 图灵完备 (Turing Completeness):任何图灵机都能被循环神经网络 (RNN) 模拟。

1.6 AI 发展简史

孕育期 (Pre-1956)

领域 人物与贡献
逻辑与推理基础 亚里士多德:三段论 (Syllogism) 形式逻辑基本规律;莱布尼茨:符号逻辑 (Symbolic Logic) 思想;布尔 (Boole, 1854):布尔代数 (Boolean Algebra),思维符号化与数学化
计算与信息基础 图灵 (Turing, 1936):图灵机 (Turing Machine);Mauchly & Eckert (1946):第一台通用电子计算机 ENIAC香农 (Shannon, 1948):信息论 (Information Theory)
迈向智能 图灵 (1950):《Computing Machinery and Intelligence》,提出图灵测试

诞生 (1956):达特茅斯会议 (Dartmouth Workshop)

  • John McCarthy 组织为期两个月的暑期研讨会。
  • 先驱:McCarthy, Minsky, Rochester, Shannon, Moore, Samuel, Selfridge, Solomonoff, Simon, Newell。
  • 核心假设:“学习的每一个方面、智能的任何其他特征,原则上都能被精确描述到可以让机器模拟的程度。”
  • 里程碑:与会者一致采用 Artificial Intelligence 作为该领域名称,标志 AI 作为独立学科正式诞生

简史年表 (1950s–2026)

时期 事件
1950s–60s 早期热情:搜索、Logic Theorist、跳棋 (Checkers) 程序
1960s–70s 现实检验:发现计算复杂性 → 第一次 AI 寒冬
1980s 知识系统:专家系统产业繁荣
1980s–90s 专家系统衰退 → 第二次 AI 寒冬;神经网络短暂回归
1990s–00s AI 成为科学:机器学习、统计方法、智能体
2010s 深度学习时代:大数据、ImageNet、AlphaGo(强化学习)
2020–23 基础模型时代:生成式 AI、LLM(如 ChatGPT)兴起
2024–26 Agentic AI 与具身智能:从被动感知转向主动推理与物理交互;自主智能体、具身 VLA 模型用于长程复杂操作

1.7 AI 现状与前沿 (2026)

  • 全球格局:产业高速增长,中美领跑第一梯队;依托 LLM,AI 高速渗透科研、工业与生活,进入战略部署、监管落地与生态建设的深水区。
  • 推理革命 (Reasoning Revolution):范式从"快速生成 (System-1)“转向"慢思考推理 (System-2)”;DeepSeek V3/R1 引领低成本强化学习与开源推理范式;OpenAI o 系列、Google Gemini 等确立原生多模态与深度思考新标准。
  • 具身 VLA 与复杂操作π0,π0.5,π0.6,\pi_0^{*},\,\pi_{0.5},\,\pi_{0.6},\,Motus 等 VLA 模型在非结构化环境中泛化能力显著提升;突破单一抓取,联合离散任务与连续运动规划,走向长程复杂操作。
  • Agentic AI(自主智能体):AI 从"对话框顾问"进化为"系统级执行者",代表如 OpenClaw 接管终端,赋能跨应用、跨任务的自动化。

1.8 典型 AI 应用与里程碑模型

应用一:感知、决策与物理交互

  • 智能交通与低空经济:自动驾驶(Tesla FSD v13 端到端纯视觉、华为乾崑 ADS 4.0 无图智驾城市泛化、Waymo 全无人 Robotaxi 商业运营);无人机感知与控制(大疆行业级多模态巡检大模型、软体机械臂空中作业平台)。
  • 具身智能与机器人:人形机器人(Tesla Optimus、Figure 02、宇树、智元);家庭/服务机器人(斯坦福 Mobile ALOHA 炒菜/家务、RoboCup@Home);四足机器人(宇树 Go2/B2)。
  • 计算机视觉与安防:身份识别(苹果 Face ID 3D 活体检测、商汤智慧城市);工业质检(百度智能云开物 3C 电子微米级缺陷检测);医疗影像(腾讯觅影食管癌/肺结节、联影智能 uAI)。

应用二:生成、助理与科学前沿

  • 生产力与代码生成:AI 编程(Cursor IDE 集成 Claude/o3、GitHub Copilot、DeepSeek Coder);办公智能(微软 Copilot for Microsoft 365、钉钉 AI 助理)。
  • 内容生成与大模型对话 (AIGC & LLMs):文本/推理(ChatGPT GPT-4o/o3、Gemini 3.1、DeepSeek R1、豆包);图像/视频(Sora、Veo、字节 Seedance 2.0);音乐/音频(Suno v4、Udio)。
  • 智能体与科学计算:个人助理/终端 Agent(Apple Intelligence、OpenClaw);气象/物流(华为盘古气象大模型精度超传统数值预报、京东地狼 AGV 调度);生命科学(DeepMind AlphaFold 3 高精度预测蛋白质结构,加速靶点制药与抗体设计)。

里程碑模型速查

模型 要点
ChatGPT OpenAI 2022 年 11 月发布;GPT-3 为 175B 参数 LLM;ChatGPT 在 GPT-3.5 上用监督学习 + 强化学习微调
AlphaGo 以 4:1 击败李世石,机器首次在围棋战胜人类顶尖高手;AlphaGo Zero 从 0 学起,不到 3 天以 100:0 完胜 AlphaGo
Tesla Optimus 人形机器人:28 自由度,共享汽车零部件供应链;软件 = FSD 自动驾驶 + Dojo 大脑,共享算法与数据
Open X-Embodiment 机器人界的"ImageNet 时刻"
Sora OpenAI,由文本指令生成逼真且富有想象力的场景
DeepSeek R1 在 AIME 2024、MATH-500、Codeforces 表现媲美/超越 OpenAI-o1-1217;Codeforces 得分 2441(高于 96.3% 人类);总训练成本仅 557.6 万美元(约 O1 的几十分之一);成功蒸馏出 32B/70B 等小型推理模型,Distill-Qwen-7B 在 AIME 2024 超过 QwQ-32B-Preview
OpenClaw 现象级开源自主 AI 智能体;开发者 Peter Steinberger 于 2025 年底发布(原名 Clawdbot/Moltbot),2026 年初定名 OpenClaw;自身不含大模型,作为调度中心接入 SOTA 模型(Claude/Gemini/OpenAI/本地模型)作"大脑";通过 Telegram/WhatsApp/Discord 等通讯软件交互;具备系统操作权限、长期记忆与主动性;同时引发数据隐私与恶意指令劫持的安全担忧
AlphaFold 3 高精度蛋白质结构预测

课后练习:对比 DeepSeek/ChatGPT/Gemini/豆包/Kimi/千问/星火等大模型;利用大模型协助编程解题;调研试用 OpenClaw。


第二部分:智能体 (lec2)

2.1 智能体与环境

智能体 (agent) 是任何能被视作通过传感器 (sensors) 感知环境、通过执行器 (actuators) 作用于环境的事物。

  • 例:
    • 人类智能体:传感器 = 眼、耳及其他器官;执行器 = 手、腿、嘴等身体部位。
    • 机器人智能体:传感器 = 摄像头、红外测距仪;执行器 = 各类电机。
  • 其他例子:软件机器人 (softbots)、自动调温器 (thermostats) 等。

智能体函数与程序

  • 智能体函数 (agent function):从感知历史到行动的映射 f:PAf:P^{*}\to A完全定义了智能体。
  • 智能体程序 (agent program) 在物理架构上运行以实现 ff
  • agent = architecture(架构)+ program(程序)

吸尘器世界 (Vacuum-cleaner world) — 经典示例

  • 感知 (Percepts):位置与内容,如 [A, Dirty]
  • 动作 (Actions)Left, Right, Suck, NoOp
  • 引出问题:正确的函数是什么?能否用小程序实现?
  • 现实类比:随机覆盖式扫地机器人(iRobot Roomba 3–8 系列算法)vs 规划式扫地机器人。

2.2 理性 (Rationality)

  • 智能体应努力"做正确的事"——基于其能感知的信息与能执行的动作,选择最可能成功的行动。
  • 性能度量 (Performance measure):评价智能体行为成功与否的客观准则。
    • 扫尘器例:清除的灰尘量、用时、耗电量、噪声等。

理性智能体定义:对每个可能的感知序列,理性智能体应基于该感知序列提供的证据和自身已有先验知识,选择期望最大化其性能度量的行动。

理性的三个不等式

命题 含义
Rational ≠ Omniscient(全知) 感知未必提供全部相关信息
Rational ≠ Clairvoyant(明察秋毫) 行动结果未必如预期
⇒ Rational ≠ Successful 理性不保证成功

由理性衍生出三种行为:

  • 信息收集 (information gathering / exploration):为修改未来感知、获取有用信息而采取行动。
  • 学习 (learning):弥补不全面或不正确的先验知识。
  • 自主性 (autonomy):智能体行为由自身经验决定(能学习与适应)即为自主。

即:Rationality → exploration, learning, autonomy


2.3 PEAS 描述

PEAS = Performance measure(性能度量)、Environment(环境)、Actuators(执行器)、Sensors(传感器)。用于刻画一个任务环境。

示例一:自动驾驶出租车 (automated taxi)

维度 内容
Performance safety(安全)、destination(到达)、profits(收益)、legality(合法)、comfort(舒适)
Environment 街道/高速、交通、行人、天气
Actuators 方向盘、油门、刹车、喇叭、扬声器/显示屏
Sensors 视频、加速度计、仪表、发动机传感器、键盘、GPS

示例二:互联网购物智能体 (Internet shopping agent)

维度 内容
Performance price(价格)、quality(质量)、appropriateness(合适度)、efficiency(效率)
Environment 当前与未来的网站、供应商、发货商
Actuators 向用户显示、跟踪 URL、填写表单
Sensors HTML 页面(文本、图形、脚本)

2.4 环境类型(6 个维度)

环境类型在很大程度上决定了智能体的设计。

维度 两端 定义
可观测性 Fully / Partially observable 智能体传感器是否能在每个时刻获取环境的完整状态
确定性 Deterministic / Stochastic 下一状态是否完全由当前状态与执行动作决定(若仅因其他智能体动作而不确定,称为 strategic
片段性 Episodic 片断式 / Sequential 延续式 经验是否被分为原子"片段"(每片段只感知并做单个动作,且动作选择只依赖该片段本身)。例:装配线上检测次品的机器人
静态 Static / Dynamic 智能体思考时环境是否不变(若环境本身不变但性能分数变,称为 semidynamic
离散性 Discrete / Continuous 感知与动作是否为有限、清晰可分的
智能体数 Single / Multi-agent 环境中是否只有一个智能体

真实世界是最难的组合:partially observable, stochastic, sequential, dynamic, continuous, multi-agent


2.5 智能体类型

按通用性递增排列,四种基本类型,且都可变为学习智能体

① 简单反射智能体 (Simple Reflex Agents)

  • 仅基于当前感知条件-动作规则 (condition-action rules) 行动;无内部状态。

② 有状态的反射智能体 (Reflex Agents with State / Model-based)

  • 维护内部状态以追踪世界的不可见部分,并根据变化与自身动作更新状态。

③ 目标驱动智能体 (Goal-based Agents)

  • 反射智能体仅基于预计算知识(规则)行动;目标驱动智能体通过推理哪种行动能达到目标来行动。
  • 更低效,但更自适应、灵活
  • 搜索与规划 (search and planning):寻找满足目标的动作序列;与条件-动作规则的本质区别——需考虑"如果我做…会发生什么 (what will happen if I do…)",涉及对未来推理。
  • 可在不"重编程"规则的情况下改变目标(如出租车换了新目的地)。

④ 效用驱动智能体 (Utility-based Agents)

  • 效用函数 (Utility Function):状态到实数的映射。
  • 允许在两类情形下做理性决策:
    • 权衡冲突目标 (conflicting goals);
    • 评估竞争目标 (competing goals)。
  • 更偏好的世界状态有更高效用。

⑤ 学习智能体 (Learning Agents)

⭐ 四大组件:

组件 作用
Performance element(执行元件) 即智能体函数,负责实际选择行动
Learning element(学习元件) 通过观察 performance 做出改进
Critic(评判元件) 测量智能体性能,向学习元件反馈
Problem generator(问题生成元件) 建议其他可能的行动路径(exploration)

表查找智能体 (Table-lookup Agent) 的缺点

作为反例:表巨大、建表耗时长、无自主性、即便学习也需很久才能填满表项。


2.6 大语言模型驱动的 Agentic AI(现代延伸)

范式演进:从对话系统到 Agentic AI

  • 生成式 AI 的局限:传统对话界面属被动响应系统,依赖人类输入 Prompt,输出文本/代码,缺乏与外部世界直接交互。
  • Agentic AI 定义:能够感知环境、自主多步规划 (Planning)调用工具 (Tool-use),并为达成既定目标而行动的 AI 系统。
  • 经典公式的现代重构agent = architecture + program
    • Program(认知核心):LLM 作为推理与规划的"大脑"。
    • Architecture(躯干/脚手架):现代 Agent 框架提供环境交互接口与执行环境。

现代 Agent 架构与 PEAS 映射(以 OpenClaw 为例)

PEAS 内容
Performance 任务完成准确率、API 调用效率与成本(Token 消耗)、多步推理成功率
Environment 操作系统文件目录、Web 浏览器、软件 API、本地终端命令行
Sensors 网页 DOM 树解析、RAG 读取本地知识库与文档、终端 stdout 回传
Actuators 自动执行终端脚本(Python/Shell)、鼠标/键盘 GUI 自动化、发送 HTTP 请求调用云端服务

⭐ 核心运行机制:ReAct 范式 (Reasoning and Acting)

  1. Thought(思考):LLM 接收自然语言指令,评估当前系统状态并决定下一步操作的逻辑。
  2. Action(行动):LLM 输出结构化的工具调用指令(如 JSON 格式的 search_files 工具),本地实际执行。
  3. Observation(观察):将本地执行结果(文件路径或文本截取)反馈给 LLM。
  4. Loop(循环):重复"思考 → 行动 → 观察",直到自我验证目标已完成。

OpenClaw 架构细节

  • 定位:开源自主系统操作智能体框架,将 LLM 的逻辑推理能力与 OS 级执行权限深度集成的闭环系统;实现"云端大脑 (LLM) + 本地手脚 (执行沙箱)"的物理与逻辑解耦。
  • OS 级深度集成:运行在宿主机后台(终端或常驻进程),可直接挂载文件系统、终端 (CLI) 和网络栈作为"物理环境"。
  • 多模态交互界面:无缝嵌入 Slack/Telegram/命令行等,把 Agent 转化为"数字共事者 (Digital Coworker)"。
  • 扩展的 ReAct 状态机
    1. 状态感知与思考:LLM 评估上下文 (Context),进行目标拆解 (Task Decomposition)
    2. 结构化行动:必须输出严格符合 JSON Schema 签名的函数调用 (Function Calling),框架捕获并映射到本地脚本/命令;
    3. 客观反馈注入:捕获 stdout/stderr 作为新观测拼入上下文,触发下一轮推理。
  • 动作空间 (Action Space) 决定能力边界:
    • 文件与系统工具:read_filewrite_to_filegrep_search 等;
    • 浏览器自动化:集成 Playwright/Puppeteer,将 DOM 树转为无障碍树 (A11y Tree) 实现精准点击/输入/抓取;
    • 动态技能扩展:支持用户自行编写 Python 函数注册新技能,运行时动态调用甚至自我编写脚本解决长尾需求。

系统记忆管理与个性化对齐

为避免每次启动成为"白板 (Blank Slate)",引入持久化双轨记忆系统

  • 静态系统级提示词IDENTITY.md(行为准则与响应风格)、USER.md(用户偏好、操作系统类型、工作流习惯)。
  • 动态情景记忆:本地**向量数据库(如 ChromaDB)**记录历史交互轨迹;面临相似任务时通过 RAG 召回过去成功路径或纠错经验,降低 Token 消耗、提高规划成功率。

部署挑战

  • 边缘计算与本地推理:高频思考-行动循环带来巨大延迟与 API 成本 → 将小参数模型(如 7B/8B)本地量化部署
  • 安全边界与人在回路 (Human-in-the-loop, HITL)
    • 沙箱隔离:执行环境限制在 Docker 容器或特定 VM 挂载目录,防误删核心文件;
    • 权限拦截:对不可逆高危操作(如 rm -rf、数据库 DROP、对外发邮件)强制挂起,等待人类明确授权。

⭐ Agentic AI 前沿挑战

挑战 说明
幻觉与误差累积 (Hallucination & Error Propagation) 多步规划中早期幻觉(如调用不存在的 API)会导致后续全部偏离目标,甚至死循环
安全与权限边界 (Security & Alignment) 赋予真实系统操作权限风险极大;提示词注入攻击 (Prompt Injection) 可让恶意网页隐藏指令"劫持"正在浏览的 Agent 越权破坏
环境动态性与部分可观测性 数字环境随时变化(UI 更新、网络延迟),要求强错误恢复 (Error Recovery)动态重规划 (Re-planning) 能力

关键概念速查表

名称 类型 核心内容 考点
四种 AI 定义 框架 像人/理性 × 思考/行动;教材取"理性地行动" ⭐⭐⭐
图灵测试 概念 模仿游戏,1950;暗示知识/推理/语言/学习四要素 ⭐⭐
理性智能体 核心 f:PAf:P^{*}\to A;agent = architecture + program ⭐⭐⭐
PAC 学习 理论 近似正确(R(h)ϵR(h)\le\epsilon) + 可能正确(P1δP\ge 1-\delta);样本量多项式 ⭐⭐⭐
Hoeffding 不等式 定理 R(h)R^S(h)+log(2/δ)/2mR(h)\le\hat{R}_S(h)+\sqrt{\log(2/\delta)/2m} ⭐⭐⭐
奥卡姆剃刀 原则 $R(h)\le\hat{R}_S(h)+O(\sqrt{\log_2 \mathcal{H}
通用近似 / 图灵完备 定理 前馈网近似连续函数;RNN 模拟图灵机 ⭐⭐
达特茅斯会议 历史 1956,McCarthy,AI 正式命名诞生 ⭐⭐
两次 AI 寒冬 历史 60s–70s 复杂性;80s–90s 专家系统衰退
性能度量 概念 评价行为成功与否的客观准则 ⭐⭐⭐
PEAS 框架 Performance / Environment / Actuators / Sensors ⭐⭐⭐
环境六维度 框架 可观测/确定/片段/静态/离散/单多智能体;真实世界全难 ⭐⭐⭐
智能体四类型 架构 简单反射 / 有状态 / 目标 / 效用(+ 学习智能体四组件) ⭐⭐⭐
ReAct 范式 Thought → Action → Observation → Loop ⭐⭐

本章关键概念清单

  • [ ] 能说出 AI 的四种定义思路,并解释教材为何选"理性地行动"
  • [ ] 理解图灵测试及其四大组成要素与缺点
  • [ ] 写出智能体函数 f:PAf:P^{*}\to Aagent = architecture + program
  • [ ] 区分理性、全知 (omniscient)、明察秋毫 (clairvoyant)、成功
  • [ ] 解释"理性 → exploration, learning, autonomy"
  • [ ] 默写泛化误差 R(h)R(h) 与经验误差 R^S(h)\hat{R}_S(h) 的定义与关系
  • [ ] 陈述 PAC 可学的两个辨识条件与样本量多项式条件
  • [ ] 用 Hoeffding 不等式推导 R(h)R^S(h)+log(2/δ)/2mR(h)\le\hat{R}_S(h)+\sqrt{\log(2/\delta)/2m}
  • [ ] 写出奥卡姆剃刀的不等式形式并解释其含义
  • [ ] 说出神经网络作为"新"新工具的两大理论基础
  • [ ] 梳理 AI 简史:孕育期三基础 → 1956 达特茅斯 → 两次寒冬 → 深度学习 → 大模型 → Agentic/具身
  • [ ] 给定一个智能体任务,写出其 PEAS 描述
  • [ ] 列出环境的 6 个分类维度,并指出真实世界的组合
  • [ ] 区分四种智能体类型,并说出学习智能体的四大组件
  • [ ] 说明目标驱动智能体"搜索与规划"与条件-动作规则的本质区别
  • [ ] 描述 ReAct 范式的四步循环
  • [ ] 说出 Agentic AI 的三大前沿挑战(幻觉累积/权限边界/环境动态性)