2494 字
约 8 分钟
0
AI Agent 入门:一张概念地图,看懂「大脑 + 眼睛 + 手脚」

AI Agent 入门:一张概念地图,看懂「大脑 + 眼睛 + 手脚」

如果你用 Cursor 写过代码、让 Deep Research 调研过课题、用 Manus 在浏览器里完成任务,或者让手机助手帮你订过票——你已经在使用 AI Agent 了。

这些产品形态各异,但有一个共同点:它们不再是"你问一句、它答一句"的被动对话,而是能自主规划步骤、调用工具完成任务、并根据结果调整策略的智能系统。

这篇文章是《深入理解 AI Agent》第一章的知识沉淀,用一张概念地图,把 Agent 的核心公式、运行循环、工具体系和学习机制一次讲清。

一、Agent = LLM + 上下文 + 工具

现代 Agent 的最小工程实现,可以用一个公式表达:

Agent = LLM(大语言模型)+ 上下文 + 工具

三个组件对应三句直觉:

直觉 实现 作用
大脑 LLM 思考、理解意图、规划、决策
眼睛 上下文 模型在每个决策点"看到"的全部信息
手脚 工具 感知与改变外部世界的接口

注意两个边界:

  1. 这个公式只描述 Agent 边界之内的实现,不包含环境(Environment)。Agent 与环境是闭环交互的两方。
  2. 一条铁律:没有进入上下文的信息,对模型来说就像不存在;没有被工具允许的操作,模型只能停留在文字建议上。

如果熟悉强化学习,三者可以对应:LLM ≈ 策略(Policy)、上下文 ≈ 观察空间(Observation Space)、工具 ≈ 动作空间(Action Space)。

二、观察空间与动作空间:为什么"换接口"常比"换模型"更有效

观察通道 + 动作接口共同构成 Agent 与环境的边界。 Harness 把环境返回的观察转成模型能处理的上下文,再把模型选择的行动转成对环境的工具调用。

由此得到一个对工程实践极其重要的结论:

在底层模型固定时,提升 Agent 表现最主要的系统工程手段,往往是重新定义或扩展观察空间与动作空间。
许多看似需要"更聪明模型"的问题,其实只是接口问题:把任务所需的数据纳入上下文,或把操作封装成工具,原本不可解的任务就可能变得可解。

典型案例:

  • Manus:把 Deep Research、Coding、Computer Use 三套分离的观察/动作空间合并进同一个 Agent(虚拟浏览器扩大观察空间,文件系统与代码执行扩大动作空间),不是靠换更强的模型,而是取三者的并集。
  • OpenClaw:把接口延伸到用户的数字生活——通过 WhatsApp、Telegram 等消息渠道触达 Agent,用本地 Gateway 连接 Google Drive、Notion 和本地文件系统,跨越了更大的数据边界。

产品能力的演进,本质上常常就是观察空间与动作空间的演进。

三、五类工具:Agent 的"手脚"

工具是 Agent 与外部世界交互的桥梁。按交互方向可分为五类:

类型 特征 例子
感知工具 Agent 主动获取信息(pull) 搜索、读文件、查 API
执行工具 Agent 主动改变世界 写文件、跑命令、调外部 API
协作工具 与其他智能体/人类分工 委托子 Agent、关键决策点请求人类确认(HITL)
事件触发工具 外部事件唤醒 Agent(push) 新邮件、定时任务、Webhook
用户沟通工具 Agent 主动传递信息 汇报进度、主动关怀

判断"协作 vs 沟通"的一个简单问法:拿掉这次互动,任务还能继续吗? 能 → 沟通;不能 → 协作。

工具设计还有一条核心原则:通用基础能力用于组合与探索;专用工具用于约束高风险和强业务规则操作(支付、删除、发邮件等要参数明确、权限受限、全程可审计)。

四、LLM:Agent 的大脑

LLM 是 Agent 的决策核心:解析真实意图 → 拆解任务 → 持续判断"下一步做什么、调不调工具、调哪个、传什么参数"。

两个值得记住的观点:

1. 内部思考:LLM Agent 在行动之前可以先规划和推演,不改变环境却能提升行动质量。这来自预训练积累的世界知识与逻辑规则,所以它不是盲目的随机探索,而是建立在结构化知识体系之上。

2. 模型即 Agent 与 Harness:模型越强,围绕它的 Harness 就越关键。Harness 原指马具——不是为了限制马,而是把力量引导到正确方向。在 Agent 里,模型是那匹强大但不可预测的马,Harness 是引导它的工程外壳:上下文管理、工具接口、安全约束、验证与纠正。

关于"模型会不会吃掉 Harness"(苦涩的教训),书里的立场是方向认同、节奏务实:工具调用、长程规划确实已从外部编排变成模型原生能力;但训练以月计,模型无法一次内化真实业务的所有约束,所以——

模型还做不稳的,Harness 先补上;模型每内化一层,Harness 就卸下一层,转而兜底新的能力前沿。

五、三个学习机制:Agent 是怎么变强的

按照更新发生的位置和持续时间,Agent 的学习有三条互补路径:

机制 更新位置 特点
上下文适应 当前会话的上下文 快、便宜、短命(换会话就没了)
外部产物更新 知识文档 / Prompt / Skill / 程序与 Harness 持久、可控、可审计,需人工沉淀(如 CLAUDE.md)
参数更新 模型参数本身 最重,能内化"说不出来"的高维能力(SFT / RL)

判断用哪条路,可以问:这个能力写得成文档吗? 能 → 外部产物;写不成(如"像医生一样看片"、"谈判的语气")→ 参数更新。

注意区分:RAG 是把外部知识送进上下文,属于"上下文/知识"范畴,而不是参数更新。

六、上下文:Agent 的眼睛(五个组成部分)

从 API 视角看,每次调用 LLM 的上下文由五部分组成:

组成 说明 性质
系统提示词 岗位说明书:身份、权限、行为准则 静态前缀
工具定义 声明可用工具的名称、描述、参数格式 静态前缀
用户消息 用户输入(可含 RAG 检索引入的外部知识) 动态历史
模型回复 reasoning(思考)+ content(回复)+ tool_calls(行动) 动态历史
工具执行结果 工具跑完返回的结果,是闭环控制的关键 动态历史

消融实验的核心洞察(实验 1-1):上下文决定 Agent 能看到什么,Agent 只能基于看到的信息决策。但组件并不等价,衡量的标准是它的信息能否从别处重建。两个最有意思的发现:

  • 拿掉工具定义:模型照样给出一份格式工整、语气笃定的答案,但数据是编的(来自参数记忆)——"给出了回答"不等于"完成了任务"。
  • 拿掉工具执行结果:Agent 变成"盲目执行",反复重试直到耗尽迭代预算——闭环断了,它就原地打转。

七、ReAct 循环:想 → 做 → 看

Agent 执行任务的核心模式是 ReAct(Reasoning + Acting),实际包含三个环节:

思考(下一步该做什么)→ 行动(调用工具)→ 观察(读取工具结果)→ 再思考……

信息只在眼睛(上下文)和大脑(LLM)之间流动,手脚(工具)负责与环境交互。工具执行结果是闭环的"反馈信号"——没有它,Agent 无法判断行动是否有效,最终卡死在重复执行里。

八、Model–Harness:把一切串起来的结构

  • 外层:Agent 与 Environment 的闭环交互(观察 → 决策 → 行动 → 新观察)。
  • 内层:Model 负责策略决策;Harness 负责构造上下文、暴露工具接口、维护循环与状态、实施权限验证与纠正。

用公式展开:LLM 对应 Model,"上下文 + 工具"构成最小 Harness;生产系统还会加上约束、验证与纠正。

结语

一张图收尾:

Agent = 大脑(LLM) + 眼睛(上下文) + 手脚(工具)
   ├─ 眼睛的 5 个组成
   ├─ ReAct 循环:思考 → 行动 → 观察
   ├─ 五类工具:感知 / 执行 / 协作 / 事件触发 / 用户沟通
   ├─ 三个学习机制:上下文适应 / 外部产物 / 参数更新
   └─ Model–Harness:大脑 vs 引导它的工程外壳

上下文决定 Agent 能看到什么,工具决定它能做什么,LLM 决定它怎么做;三者靠 ReAct 循环协作,能力则按"临场 → 积累 → 内化"三个尺度持续变强。掌握这些设计原则,比记住某个具体模型或技巧更重要——好的架构原则,穿越模型的迭代周期。

AI Agent 入门:一张概念地图,看懂「大脑 + 眼睛 + 手脚」
https://www.clxhxhhr.top/posts/4581/
作者
clxstart
发布于
2026-10-08
许可协议
CC BY-NC-SA 4.0
评论
0 条
还没有评论,先写一条吧。