Ch1-2 绪论与智能体 (Introduction & Intelligent Agents)
课件:lec1_intro.pdf (62 页) + lec2.pdf (45 页)
教材:Artificial Intelligence: A Modern Approach (Russell & Norvig), Ch1 & Ch2
教师:吉建民,USTC
0. 本章概述
本章是整门课的起点,由"绪论"与"智能体"两节合并。绪论回答"AI 是什么、从哪来、到哪去";智能体给出贯穿全书的统一框架——理性智能体 (Rational Agent)。后续所有主题(搜索、逻辑、不确定性、学习)都可视为不同类型智能体的能力。
| 子主题 | 核心内容 | 重要程度 |
|---|---|---|
| AI 的四种定义思路 | 像人行动/像人思考/理性思考/理性行动;图灵测试 | ⭐⭐⭐ |
| 理性智能体框架 | agent = architecture + program;f: P*→A | ⭐⭐⭐ |
| 机器学习为何可能 | PAC 学习、Hoeffding 不等式、奥卡姆剃刀 | ⭐⭐⭐ |
| 理性 (Rationality) | 性能度量;理性 ≠ 全知 ≠ 必然成功 | ⭐⭐⭐ |
| PEAS 描述 | Performance / Environment / Actuators / Sensors | ⭐⭐⭐ |
| 环境类型(6 维度) | 可观测性/确定性/片段性/静态/离散/单多智能体 | ⭐⭐⭐ |
| 智能体类型 | 反射 / 有状态 / 目标驱动 / 效用驱动 / 学习 | ⭐⭐⭐ |
| Agentic AI(现代) | ReAct 范式、OpenClaw、LLM 驱动的智能体 | ⭐⭐ |
| AI 发展简史与现状 | 达特茅斯会议、两次寒冬、深度学习、大模型、具身智能 | ⭐⭐ |
第一部分:人工智能绪论 (lec1)
1.1 课程概览
教材与考核
- 主教材:Artificial Intelligence: A Modern Approach (3rd Edition),S. Russell & P. Norvig(中译《人工智能——一种现代方法》)
- 参考书:机器学习(周志华,2016)、《动手学深度学习》(第二版)
- 学期总评 = 期末考试 (60%) + 书面作业 (15%) + 实验部分 (25%)
课程六大模块
| 部分 | 主题 | 教材章节 |
|---|---|---|
| 一 | 人工智能概述 / Introduction and Agents | Ch 1, 2 |
| 二 | 问题求解 / Search(搜索、有信息搜索、CSP、博弈规划) | Ch 3–6 |
| 三 | 知识、推理与规划 / Logic, Knowledge, Reasoning, Planning | Ch 7–12 |
| 四 | 不确定知识与推理 / Uncertainty and Decision Making(贝叶斯网、MDP、POMDP、随机博弈) | Ch 13–17 |
| 五 | 学习 / Learning(ML、DL、RL) | Ch 18–21 |
| 六 | 应用 / NLP, Perception, Robotics | Ch 22–25 |
课程定位
- 广义"人工智能"含搜索、知识表示与推理、规划、MDP、贝叶斯网等经典工作;当下大众语境中的"AI"多指机器学习/深度学习/大模型。
- 本课定位:面向计算机专业,熟练掌握 IT 工程师应具备的 AI 基础技术;同时作为索引介绍 ML/NN/大模型等新方向,仅要求了解。
- 进阶建议:系统入门 DL → 自学"动手学深度学习"(李沐,d2l.ai);精深 → 选定 CV/NLP/多模态等具体领域,从综述读起、动手实现;成专家 → 加入实验室做前沿研究。
1.2 什么是 AI?—— 四种定义思路
教材主张:“理性地行动 (acting rationally)”。
四种思路的二维划分(按"像人/理性" × “思考/行动”):
| 像人 (Humanly) | 理性 (Rationally) | |
|---|---|---|
| 思考 | 认知科学 (Cognitive Science) | 思维法则 (Laws of Thought) |
| 行动 | 图灵测试 (Turing Test) | 理性智能体 (Rational Agent) ✅ |
① 像人一样行动 (Acting Humanly):图灵测试
- Turing (1950) “Computing Machinery and Intelligence”:将"机器能否思考?“转化为"机器能否表现出智能行为?”
- 模仿游戏 (Imitation Game):人类裁判通过问答区分机器与真人。
- 预言:到 2000 年,机器可能有 30% 概率骗过普通人 5 分钟;并预见了此后 50 年反对 AI 的主要论点。
- 暗示 AI 的核心组成部分:知识 (knowledge)、推理 (reasoning)、语言理解 (language understanding)、学习 (learning)。
- ⚠️ 缺点:不可复现、非构造性、难以做数学分析。
② 像人一样思考 (Thinking Humanly):认知科学
- 1960s"认知革命":信息加工心理学取代行为主义。
- 需要关于大脑内部活动的科学理论,涉及抽象层次(“知识"还是"电路”?)与验证方式(自上而下预测行为 / 自下而上神经数据)。
- 现已与 AI 分离:发展为认知科学 (Cognitive Science) 与认知神经科学 (Cognitive Neuroscience)。
③ 理性地思考 (Thinking Rationally):思维法则
- 规范性 (normative / prescriptive) 而非描述性。
- 源于亚里士多德:什么是正确的论证/思维过程?古希腊各学派发展出各种逻辑(思想的符号化与推导规则)。
- 经数学、哲学一脉相承到现代 AI。
- ⚠️ 问题:
- 并非所有智能行为都由逻辑深思熟虑驱动;
- "思考的目的是什么?该有什么想法?"难以回答;
- 逻辑系统在不确定性下常做错事(部分学者认同此点,部分不认同)。
④ 理性地行动 (Acting Rationally) ← 教材采用
- 理性行为 (rational behavior) = 做正确的事:在给定可得信息下,期望最大化目标达成。
- 不一定需要思考(如眨眼反射);但思考应服务于理性行动。
- 引亚里士多德《尼各马可伦理学》(Nicomachean Ethics):“一切技艺与探索、一切行动与追求,都被认为指向某种善。”
- 关键区分:
- 理性 ≠ 成功 (rational ≠ successful)
- 不理性 ≠ 疯狂 (irrationality = 次优行动,而非 insane)
- 完全依赖目标 (goals)
- 现实世界充满不确定性与复杂性,通常只是近似理性。
1.3 理性智能体 (Rational Agents)
⭐ 这是贯穿全书的统一定义:
- 智能体 (agent) 是能够感知 (perceive) 和行动 (act) 的实体。
- 本课核心:设计理性智能体。
- 抽象地,智能体是一个从感知历史到行动的函数:
( 为所有可能的感知序列, 为动作集)
- 对给定环境类与任务类,寻找性能最优的智能体(类)。
- ⚠️ 注意:计算资源有限使完美理性不可达 → 实际目标是"为给定机器资源设计最好的程序"。
学习与具身案例:自动驾驶架构在 2020 年前后从"分模块流水线"转向"端到端"。
1.4 机器学习:表示 + 评价 + 优化
- 机器学习 ≈ 拟合一个函数。
- 学习 = 表示 + 评价 + 优化:
- 表示 (Representation):确定假设空间 (hypothesis space) 。
- 评价 (Evaluation):用评价函数(目标函数/打分函数)判断优劣。
- 优化 (Optimization):用搜索方法在假设空间中找到评价函数得分最高的函数。
1.4.1 误差定义
设假设 ,目标概念 ,分布 ,样本集 :
- 泛化误差 (generalization error):
- 经验误差 (empirical error):
- 两者关系:因为 由 独立同分布产生,
(经验误差是泛化误差的无偏估计)
1.4.2 PAC 学习(“机器学习为什么可能”)
"好的假设"需同时满足两个 PAC 辨识条件:
- 近似正确 (Approximately Correct):泛化误差足够小,即 。
- 可能正确 (Probably Correct):以大概率近似正确,即 。
且所需样本数是关于 的多项式函数。
⭐ PAC 可学 (PAC-Learnable) 定义:概念类 称为 PAC 可学,若存在算法 和多项式 ,使得对任意 、任意分布 (实例长度 )、任意目标概念 ,当样本量
有 。若 运行时间也是多项式,则称高效 PAC 可学, 为 的 PAC 学习算法。
1.4.3 独立同分布 (i.i.d.)
独立同分布当且仅当:
- 独立性:任意有限个 的联合分布 = 各自边缘分布之积;即每个变量的取值不受其他变量影响。
- 同分布性:所有变量服从相同分布。
⚠️ i.i.d. 是理想化假设,实际数据常违反(如时间序列自相关、空间聚类效应),需用时序分析、混合模型,或数据预处理(随机打乱)逼近。
1.4.4 Hoeffding 不等式
定理(Wassily Hoeffding, 1963):设 i.i.d.,,对任意 :
- 直觉:取值范围有界的独立变量,随样本量增加,其均值越来越集中于期望附近;上界随 指数级下降。
- 特例 :。
1.4.5 经验误差与泛化误差的关系
由 代入 Hoeffding( 情形):
令 ,则对固定假设 ,以至少 的概率成立:
1.4.6 奥卡姆剃刀 (Occam’s Razor)
对有限假设集 :
- 固定 时,要达到与一致情形相同的保证,需要平方量级更大的标注样本。
- 即 Occam’s Razor(奥卡姆剃刀):“如无必要,勿增实体” / 最简单的解释最好。
1.4.7 从特征工程到深度学习
- 传统 ML 流程中"特征表达"靠人工提取,耗时且关键 → 能否自动学习特征?能,即深度学习 (Deep Learning / 无监督特征学习)。
- 衍生:深度神经网络、计算图、CNN;代表模型 BERT、GPT-3。
- DeepSeek(范例):
- V3:671B 参数、推理激活 37B;核心创新含 MoE 架构(对 Transformer 的改进)、数据并行-专家并行-流水并行、MTP、分布式混合精度训练、DualPipe 训练框架;大幅降低训练/推理成本。
- R1:用强化学习 GRPO(多组策略竞争、组内相对奖励)优化生成更好的 CoT,提升 LLM 推理能力;R1 生成的带推理过程 CoT 数据可蒸馏小模型,显著提升其推理能力。
1.5 "新"新工具 (Novum Organum):神经网络的认识论
借"自然科学如何可能?"这一哲学命题,引出神经网络作为新工具的地位。
- 英国经验主义(休谟):没有绝对真理,只是经验的归纳整理、compact 的表示。
- 大陆理性主义(莱布尼茨):仿《几何原本》,从几条公设出发形式化推理构建完整理论。
- 哥德尔不完备性定理:任何足够复杂(含数学归纳法)的公理系统不能既可靠又完备;可靠系统中必有真但不可证的命题。
- 不同公理系统(理论)彼此不能证伪。
- 康德、黑格尔:人通过先验概念理解世界——不是世界本就如此,而是我们只能以公理系统方式理解复杂世界。
- 培根《新工具》:公理系统 + 科学实验。
- "新"新工具 = 神经网络、端到端学习,其理论基础有二:
- 通用近似 (Universal Approximation):任何连续函数都能被前馈神经网络以任意小误差近似。
- 图灵完备 (Turing Completeness):任何图灵机都能被循环神经网络 (RNN) 模拟。
1.6 AI 发展简史
孕育期 (Pre-1956)
| 领域 | 人物与贡献 |
|---|---|
| 逻辑与推理基础 | 亚里士多德:三段论 (Syllogism) 形式逻辑基本规律;莱布尼茨:符号逻辑 (Symbolic Logic) 思想;布尔 (Boole, 1854):布尔代数 (Boolean Algebra),思维符号化与数学化 |
| 计算与信息基础 | 图灵 (Turing, 1936):图灵机 (Turing Machine);Mauchly & Eckert (1946):第一台通用电子计算机 ENIAC;香农 (Shannon, 1948):信息论 (Information Theory) |
| 迈向智能 | 图灵 (1950):《Computing Machinery and Intelligence》,提出图灵测试 |
诞生 (1956):达特茅斯会议 (Dartmouth Workshop)
- 由 John McCarthy 组织为期两个月的暑期研讨会。
- 先驱:McCarthy, Minsky, Rochester, Shannon, Moore, Samuel, Selfridge, Solomonoff, Simon, Newell。
- 核心假设:“学习的每一个方面、智能的任何其他特征,原则上都能被精确描述到可以让机器模拟的程度。”
- 里程碑:与会者一致采用 Artificial Intelligence 作为该领域名称,标志 AI 作为独立学科正式诞生。
简史年表 (1950s–2026)
| 时期 | 事件 |
|---|---|
| 1950s–60s | 早期热情:搜索、Logic Theorist、跳棋 (Checkers) 程序 |
| 1960s–70s | 现实检验:发现计算复杂性 → 第一次 AI 寒冬 |
| 1980s | 知识系统:专家系统产业繁荣 |
| 1980s–90s | 专家系统衰退 → 第二次 AI 寒冬;神经网络短暂回归 |
| 1990s–00s | AI 成为科学:机器学习、统计方法、智能体 |
| 2010s | 深度学习时代:大数据、ImageNet、AlphaGo(强化学习) |
| 2020–23 | 基础模型时代:生成式 AI、LLM(如 ChatGPT)兴起 |
| 2024–26 | Agentic AI 与具身智能:从被动感知转向主动推理与物理交互;自主智能体、具身 VLA 模型用于长程复杂操作 |
1.7 AI 现状与前沿 (2026)
- 全球格局:产业高速增长,中美领跑第一梯队;依托 LLM,AI 高速渗透科研、工业与生活,进入战略部署、监管落地与生态建设的深水区。
- 推理革命 (Reasoning Revolution):范式从"快速生成 (System-1)“转向"慢思考推理 (System-2)”;DeepSeek V3/R1 引领低成本强化学习与开源推理范式;OpenAI o 系列、Google Gemini 等确立原生多模态与深度思考新标准。
- 具身 VLA 与复杂操作:Motus 等 VLA 模型在非结构化环境中泛化能力显著提升;突破单一抓取,联合离散任务与连续运动规划,走向长程复杂操作。
- Agentic AI(自主智能体):AI 从"对话框顾问"进化为"系统级执行者",代表如 OpenClaw 接管终端,赋能跨应用、跨任务的自动化。
1.8 典型 AI 应用与里程碑模型
应用一:感知、决策与物理交互
- 智能交通与低空经济:自动驾驶(Tesla FSD v13 端到端纯视觉、华为乾崑 ADS 4.0 无图智驾城市泛化、Waymo 全无人 Robotaxi 商业运营);无人机感知与控制(大疆行业级多模态巡检大模型、软体机械臂空中作业平台)。
- 具身智能与机器人:人形机器人(Tesla Optimus、Figure 02、宇树、智元);家庭/服务机器人(斯坦福 Mobile ALOHA 炒菜/家务、RoboCup@Home);四足机器人(宇树 Go2/B2)。
- 计算机视觉与安防:身份识别(苹果 Face ID 3D 活体检测、商汤智慧城市);工业质检(百度智能云开物 3C 电子微米级缺陷检测);医疗影像(腾讯觅影食管癌/肺结节、联影智能 uAI)。
应用二:生成、助理与科学前沿
- 生产力与代码生成:AI 编程(Cursor IDE 集成 Claude/o3、GitHub Copilot、DeepSeek Coder);办公智能(微软 Copilot for Microsoft 365、钉钉 AI 助理)。
- 内容生成与大模型对话 (AIGC & LLMs):文本/推理(ChatGPT GPT-4o/o3、Gemini 3.1、DeepSeek R1、豆包);图像/视频(Sora、Veo、字节 Seedance 2.0);音乐/音频(Suno v4、Udio)。
- 智能体与科学计算:个人助理/终端 Agent(Apple Intelligence、OpenClaw);气象/物流(华为盘古气象大模型精度超传统数值预报、京东地狼 AGV 调度);生命科学(DeepMind AlphaFold 3 高精度预测蛋白质结构,加速靶点制药与抗体设计)。
里程碑模型速查
| 模型 | 要点 |
|---|---|
| ChatGPT | OpenAI 2022 年 11 月发布;GPT-3 为 175B 参数 LLM;ChatGPT 在 GPT-3.5 上用监督学习 + 强化学习微调 |
| AlphaGo | 以 4:1 击败李世石,机器首次在围棋战胜人类顶尖高手;AlphaGo Zero 从 0 学起,不到 3 天以 100:0 完胜 AlphaGo |
| Tesla Optimus | 人形机器人:28 自由度,共享汽车零部件供应链;软件 = FSD 自动驾驶 + Dojo 大脑,共享算法与数据 |
| Open X-Embodiment | 机器人界的"ImageNet 时刻" |
| Sora | OpenAI,由文本指令生成逼真且富有想象力的场景 |
| DeepSeek R1 | 在 AIME 2024、MATH-500、Codeforces 表现媲美/超越 OpenAI-o1-1217;Codeforces 得分 2441(高于 96.3% 人类);总训练成本仅 557.6 万美元(约 O1 的几十分之一);成功蒸馏出 32B/70B 等小型推理模型,Distill-Qwen-7B 在 AIME 2024 超过 QwQ-32B-Preview |
| OpenClaw | 现象级开源自主 AI 智能体;开发者 Peter Steinberger 于 2025 年底发布(原名 Clawdbot/Moltbot),2026 年初定名 OpenClaw;自身不含大模型,作为调度中心接入 SOTA 模型(Claude/Gemini/OpenAI/本地模型)作"大脑";通过 Telegram/WhatsApp/Discord 等通讯软件交互;具备系统操作权限、长期记忆与主动性;同时引发数据隐私与恶意指令劫持的安全担忧 |
| AlphaFold 3 | 高精度蛋白质结构预测 |
课后练习:对比 DeepSeek/ChatGPT/Gemini/豆包/Kimi/千问/星火等大模型;利用大模型协助编程解题;调研试用 OpenClaw。
第二部分:智能体 (lec2)
2.1 智能体与环境
⭐ 智能体 (agent) 是任何能被视作通过传感器 (sensors) 感知环境、通过执行器 (actuators) 作用于环境的事物。
- 例:
- 人类智能体:传感器 = 眼、耳及其他器官;执行器 = 手、腿、嘴等身体部位。
- 机器人智能体:传感器 = 摄像头、红外测距仪;执行器 = 各类电机。
- 其他例子:软件机器人 (softbots)、自动调温器 (thermostats) 等。
智能体函数与程序
- 智能体函数 (agent function):从感知历史到行动的映射 ,完全定义了智能体。
- 智能体程序 (agent program) 在物理架构上运行以实现 。
- ⭐ agent = architecture(架构)+ program(程序)
吸尘器世界 (Vacuum-cleaner world) — 经典示例
- 感知 (Percepts):位置与内容,如
[A, Dirty]。 - 动作 (Actions):
Left, Right, Suck, NoOp。 - 引出问题:正确的函数是什么?能否用小程序实现?
- 现实类比:随机覆盖式扫地机器人(iRobot Roomba 3–8 系列算法)vs 规划式扫地机器人。
2.2 理性 (Rationality)
- 智能体应努力"做正确的事"——基于其能感知的信息与能执行的动作,选择最可能成功的行动。
- 性能度量 (Performance measure):评价智能体行为成功与否的客观准则。
- 扫尘器例:清除的灰尘量、用时、耗电量、噪声等。
⭐ 理性智能体定义:对每个可能的感知序列,理性智能体应基于该感知序列提供的证据和自身已有先验知识,选择期望最大化其性能度量的行动。
理性的三个不等式
| 命题 | 含义 |
|---|---|
| Rational ≠ Omniscient(全知) | 感知未必提供全部相关信息 |
| Rational ≠ Clairvoyant(明察秋毫) | 行动结果未必如预期 |
| ⇒ Rational ≠ Successful | 理性不保证成功 |
由理性衍生出三种行为:
- 信息收集 (information gathering / exploration):为修改未来感知、获取有用信息而采取行动。
- 学习 (learning):弥补不全面或不正确的先验知识。
- 自主性 (autonomy):智能体行为由自身经验决定(能学习与适应)即为自主。
即:Rationality → exploration, learning, autonomy。
2.3 PEAS 描述
⭐ PEAS = Performance measure(性能度量)、Environment(环境)、Actuators(执行器)、Sensors(传感器)。用于刻画一个任务环境。
示例一:自动驾驶出租车 (automated taxi)
| 维度 | 内容 |
|---|---|
| Performance | safety(安全)、destination(到达)、profits(收益)、legality(合法)、comfort(舒适) |
| Environment | 街道/高速、交通、行人、天气 |
| Actuators | 方向盘、油门、刹车、喇叭、扬声器/显示屏 |
| Sensors | 视频、加速度计、仪表、发动机传感器、键盘、GPS |
示例二:互联网购物智能体 (Internet shopping agent)
| 维度 | 内容 |
|---|---|
| Performance | price(价格)、quality(质量)、appropriateness(合适度)、efficiency(效率) |
| Environment | 当前与未来的网站、供应商、发货商 |
| Actuators | 向用户显示、跟踪 URL、填写表单 |
| Sensors | HTML 页面(文本、图形、脚本) |
2.4 环境类型(6 个维度)
环境类型在很大程度上决定了智能体的设计。
| 维度 | 两端 | 定义 |
|---|---|---|
| 可观测性 | Fully / Partially observable | 智能体传感器是否能在每个时刻获取环境的完整状态 |
| 确定性 | Deterministic / Stochastic | 下一状态是否完全由当前状态与执行动作决定(若仅因其他智能体动作而不确定,称为 strategic) |
| 片段性 | Episodic 片断式 / Sequential 延续式 | 经验是否被分为原子"片段"(每片段只感知并做单个动作,且动作选择只依赖该片段本身)。例:装配线上检测次品的机器人 |
| 静态 | Static / Dynamic | 智能体思考时环境是否不变(若环境本身不变但性能分数变,称为 semidynamic) |
| 离散性 | Discrete / Continuous | 感知与动作是否为有限、清晰可分的 |
| 智能体数 | Single / Multi-agent | 环境中是否只有一个智能体 |
⭐ 真实世界是最难的组合:partially observable, stochastic, sequential, dynamic, continuous, multi-agent。
2.5 智能体类型
按通用性递增排列,四种基本类型,且都可变为学习智能体。
① 简单反射智能体 (Simple Reflex Agents)
- 仅基于当前感知与 条件-动作规则 (condition-action rules) 行动;无内部状态。
② 有状态的反射智能体 (Reflex Agents with State / Model-based)
- 维护内部状态以追踪世界的不可见部分,并根据变化与自身动作更新状态。
③ 目标驱动智能体 (Goal-based Agents)
- 反射智能体仅基于预计算知识(规则)行动;目标驱动智能体通过推理哪种行动能达到目标来行动。
- 更低效,但更自适应、灵活。
- 搜索与规划 (search and planning):寻找满足目标的动作序列;与条件-动作规则的本质区别——需考虑"如果我做…会发生什么 (what will happen if I do…)",涉及对未来推理。
- 可在不"重编程"规则的情况下改变目标(如出租车换了新目的地)。
④ 效用驱动智能体 (Utility-based Agents)
- 效用函数 (Utility Function):状态到实数的映射。
- 允许在两类情形下做理性决策:
- 权衡冲突目标 (conflicting goals);
- 评估竞争目标 (competing goals)。
- 更偏好的世界状态有更高效用。
⑤ 学习智能体 (Learning Agents)
⭐ 四大组件:
| 组件 | 作用 |
|---|---|
| Performance element(执行元件) | 即智能体函数,负责实际选择行动 |
| Learning element(学习元件) | 通过观察 performance 做出改进 |
| Critic(评判元件) | 测量智能体性能,向学习元件反馈 |
| Problem generator(问题生成元件) | 建议其他可能的行动路径(exploration) |
表查找智能体 (Table-lookup Agent) 的缺点
作为反例:表巨大、建表耗时长、无自主性、即便学习也需很久才能填满表项。
2.6 大语言模型驱动的 Agentic AI(现代延伸)
范式演进:从对话系统到 Agentic AI
- 生成式 AI 的局限:传统对话界面属被动响应系统,依赖人类输入 Prompt,输出文本/代码,缺乏与外部世界直接交互。
- ⭐ Agentic AI 定义:能够感知环境、自主多步规划 (Planning)、调用工具 (Tool-use),并为达成既定目标而行动的 AI 系统。
- 经典公式的现代重构:
agent = architecture + program- Program(认知核心):LLM 作为推理与规划的"大脑"。
- Architecture(躯干/脚手架):现代 Agent 框架提供环境交互接口与执行环境。
现代 Agent 架构与 PEAS 映射(以 OpenClaw 为例)
| PEAS | 内容 |
|---|---|
| Performance | 任务完成准确率、API 调用效率与成本(Token 消耗)、多步推理成功率 |
| Environment | 操作系统文件目录、Web 浏览器、软件 API、本地终端命令行 |
| Sensors | 网页 DOM 树解析、RAG 读取本地知识库与文档、终端 stdout 回传 |
| Actuators | 自动执行终端脚本(Python/Shell)、鼠标/键盘 GUI 自动化、发送 HTTP 请求调用云端服务 |
⭐ 核心运行机制:ReAct 范式 (Reasoning and Acting)
- Thought(思考):LLM 接收自然语言指令,评估当前系统状态并决定下一步操作的逻辑。
- Action(行动):LLM 输出结构化的工具调用指令(如 JSON 格式的
search_files工具),本地实际执行。 - Observation(观察):将本地执行结果(文件路径或文本截取)反馈给 LLM。
- Loop(循环):重复"思考 → 行动 → 观察",直到自我验证目标已完成。
OpenClaw 架构细节
- 定位:开源自主系统操作智能体框架,将 LLM 的逻辑推理能力与 OS 级执行权限深度集成的闭环系统;实现"云端大脑 (LLM) + 本地手脚 (执行沙箱)"的物理与逻辑解耦。
- OS 级深度集成:运行在宿主机后台(终端或常驻进程),可直接挂载文件系统、终端 (CLI) 和网络栈作为"物理环境"。
- 多模态交互界面:无缝嵌入 Slack/Telegram/命令行等,把 Agent 转化为"数字共事者 (Digital Coworker)"。
- 扩展的 ReAct 状态机:
- 状态感知与思考:LLM 评估上下文 (Context),进行目标拆解 (Task Decomposition);
- 结构化行动:必须输出严格符合 JSON Schema 签名的函数调用 (Function Calling),框架捕获并映射到本地脚本/命令;
- 客观反馈注入:捕获 stdout/stderr 作为新观测拼入上下文,触发下一轮推理。
- 动作空间 (Action Space) 决定能力边界:
- 文件与系统工具:
read_file、write_to_file、grep_search等; - 浏览器自动化:集成 Playwright/Puppeteer,将 DOM 树转为无障碍树 (A11y Tree) 实现精准点击/输入/抓取;
- 动态技能扩展:支持用户自行编写 Python 函数注册新技能,运行时动态调用甚至自我编写脚本解决长尾需求。
- 文件与系统工具:
系统记忆管理与个性化对齐
为避免每次启动成为"白板 (Blank Slate)",引入持久化双轨记忆系统:
- 静态系统级提示词:
IDENTITY.md(行为准则与响应风格)、USER.md(用户偏好、操作系统类型、工作流习惯)。 - 动态情景记忆:本地**向量数据库(如 ChromaDB)**记录历史交互轨迹;面临相似任务时通过 RAG 召回过去成功路径或纠错经验,降低 Token 消耗、提高规划成功率。
部署挑战
- 边缘计算与本地推理:高频思考-行动循环带来巨大延迟与 API 成本 → 将小参数模型(如 7B/8B)本地量化部署。
- 安全边界与人在回路 (Human-in-the-loop, HITL):
- 沙箱隔离:执行环境限制在 Docker 容器或特定 VM 挂载目录,防误删核心文件;
- 权限拦截:对不可逆高危操作(如
rm -rf、数据库DROP、对外发邮件)强制挂起,等待人类明确授权。
⭐ Agentic AI 前沿挑战
| 挑战 | 说明 |
|---|---|
| 幻觉与误差累积 (Hallucination & Error Propagation) | 多步规划中早期幻觉(如调用不存在的 API)会导致后续全部偏离目标,甚至死循环 |
| 安全与权限边界 (Security & Alignment) | 赋予真实系统操作权限风险极大;提示词注入攻击 (Prompt Injection) 可让恶意网页隐藏指令"劫持"正在浏览的 Agent 越权破坏 |
| 环境动态性与部分可观测性 | 数字环境随时变化(UI 更新、网络延迟),要求强错误恢复 (Error Recovery) 与动态重规划 (Re-planning) 能力 |
关键概念速查表
| 名称 | 类型 | 核心内容 | 考点 |
|---|---|---|---|
| 四种 AI 定义 | 框架 | 像人/理性 × 思考/行动;教材取"理性地行动" | ⭐⭐⭐ |
| 图灵测试 | 概念 | 模仿游戏,1950;暗示知识/推理/语言/学习四要素 | ⭐⭐ |
| 理性智能体 | 核心 | ;agent = architecture + program | ⭐⭐⭐ |
| PAC 学习 | 理论 | 近似正确() + 可能正确();样本量多项式 | ⭐⭐⭐ |
| Hoeffding 不等式 | 定理 | ⭐⭐⭐ | |
| 奥卡姆剃刀 | 原则 | $R(h)\le\hat{R}_S(h)+O(\sqrt{\log_2 | \mathcal{H} |
| 通用近似 / 图灵完备 | 定理 | 前馈网近似连续函数;RNN 模拟图灵机 | ⭐⭐ |
| 达特茅斯会议 | 历史 | 1956,McCarthy,AI 正式命名诞生 | ⭐⭐ |
| 两次 AI 寒冬 | 历史 | 60s–70s 复杂性;80s–90s 专家系统衰退 | ⭐ |
| 性能度量 | 概念 | 评价行为成功与否的客观准则 | ⭐⭐⭐ |
| PEAS | 框架 | Performance / Environment / Actuators / Sensors | ⭐⭐⭐ |
| 环境六维度 | 框架 | 可观测/确定/片段/静态/离散/单多智能体;真实世界全难 | ⭐⭐⭐ |
| 智能体四类型 | 架构 | 简单反射 / 有状态 / 目标 / 效用(+ 学习智能体四组件) | ⭐⭐⭐ |
| ReAct | 范式 | Thought → Action → Observation → Loop | ⭐⭐ |
本章关键概念清单
- [ ] 能说出 AI 的四种定义思路,并解释教材为何选"理性地行动"
- [ ] 理解图灵测试及其四大组成要素与缺点
- [ ] 写出智能体函数 与
agent = architecture + program - [ ] 区分理性、全知 (omniscient)、明察秋毫 (clairvoyant)、成功
- [ ] 解释"理性 → exploration, learning, autonomy"
- [ ] 默写泛化误差 与经验误差 的定义与关系
- [ ] 陈述 PAC 可学的两个辨识条件与样本量多项式条件
- [ ] 用 Hoeffding 不等式推导
- [ ] 写出奥卡姆剃刀的不等式形式并解释其含义
- [ ] 说出神经网络作为"新"新工具的两大理论基础
- [ ] 梳理 AI 简史:孕育期三基础 → 1956 达特茅斯 → 两次寒冬 → 深度学习 → 大模型 → Agentic/具身
- [ ] 给定一个智能体任务,写出其 PEAS 描述
- [ ] 列出环境的 6 个分类维度,并指出真实世界的组合
- [ ] 区分四种智能体类型,并说出学习智能体的四大组件
- [ ] 说明目标驱动智能体"搜索与规划"与条件-动作规则的本质区别
- [ ] 描述 ReAct 范式的四步循环
- [ ] 说出 Agentic AI 的三大前沿挑战(幻觉累积/权限边界/环境动态性)