Question 01
你如何定义一个基于 LLM 的智能体(Agent)?它通常由哪些核心组件构成?
一句话结论
基于 LLM 的 Agent,是以大模型为「决策大脑」、在感知–推理–行动闭环中自主完成目标的系统;核心组件通常是 感知/输入、规划与推理、记忆、工具调用、执行与反馈(以及可选的多 Agent 协作)。
核心要点
1. 定义(建议背这个版本)
LLM Agent = 以大语言模型为核心控制器的自治系统,能根据目标理解环境状态,进行规划与推理,调用工具或采取行动,并依据观察结果迭代,直到任务完成或达到终止条件。
对比普通 Chatbot:
| 维度 | Chatbot | LLM Agent |
|---|---|---|
| 交互 | 一问一答 | 多步闭环(Think → Act → Observe) |
| 能力边界 | 主要靠参数知识 | 可接工具、记忆、外部系统 |
| 目标 | 生成回复 | 完成任务(有状态、有副作用) |
| 控制流 | 单次推理 | 循环/图/工作流调度 |
一句话区分:Chatbot 回答问题;Agent 完成目标。
2. 核心组件(面试主答)
用户目标 / 环境状态
|
v
+-------------------+
| Perception 感知 | 解析输入、多模态、环境观测
+---------+---------+
|
v
+-------------------+
| Planning 规划 | 任务分解、策略选择(CoT/ToT/ReAct...)
+---------+---------+
|
v
+-------------------+
| Memory 记忆 | 短期上下文 + 长期知识/经验
+---------+---------+
|
v
+-------------------+
| Tool Use 工具 | API / 检索 / 代码执行 / 浏览器等
+---------+---------+
|
v
+-------------------+
| Action + Feedback | 执行动作,拿 Observation 回灌
+---------+---------+
|
v
循环直到 Done
逐项说明(口语化):
-
LLM 核心(Brain)
负责理解意图、推理、决策「下一步做什么」。不是唯一组件,但是决策中枢。 -
感知 / 输入接口(Perception)
文本指令、对话历史、工具返回、环境观测;多模态场景还有图像/语音等。 -
规划模块(Planning)
把目标拆成子任务、选择策略、决定是否调用工具。实现上可以是 Prompt 范式(ReAct)、显式 Planner、或 Workflow 图。 -
记忆系统(Memory)
- 短期:当前会话上下文、中间推理轨迹
- 长期:向量库 / 知识库 / 用户画像 / 历史经验摘要 -
工具系统(Tools / Actions)
Function Calling、检索(RAG)、代码解释器、业务 API、浏览器等,用来突破纯文本生成的能力边界。 -
执行与观察闭环(Act → Observe)
真正产生副作用或获取外部信息,再把结果喂回 LLM,形成「试错–修正」。 -
(可选)协作与编排(Orchestration / Multi-Agent)
路由、角色分工、Critic/Reflect、人机在环(HITL)。
3. 形式化一点(加分)
可把单步决策写成:
[
a_t = \pi_\theta(o_t, g, m_t)
]
- (g):目标
- (o_t):当前观测
- (m_t):记忆状态
- (a_t):动作(回复 / tool call / 终止)
- (\pi_\theta):由 LLM(+策略/规则)实现的策略
然后环境返回 (o_{t+1}),更新记忆,继续循环。
面试加分项
- 强调「闭环」而不是「组件清单」:组件可以缺,但没有 Act–Observe 循环通常不算完整 Agent。
- 区分 Agent / Workflow:
- Workflow:路径相对固定(DAG/状态机)
- Agent:运行时由模型动态选路
生产里常是 Workflow 兜底 + Agent 局部自治。 - 提一句评估:任务成功率、步数/成本、工具调用正确率、幻觉率、安全性(越权/隐私)。
- 结合项目:用自己做过的客服/检索/代码 Agent,对照上面组件各映射到哪一块。
追问预案
Q: Agent 和 RAG 的关系?
A: RAG 是一种「检索工具/记忆手段」;Agent 可以在循环中决定何时检索、检索什么、如何用检索结果再行动。
Q: 最小 Agent 长什么样?
A: LLM + 工具注册 + ReAct 循环 + 终止条件;记忆可以先只做上下文窗口。
Q: 你项目里哪些是 Agent、哪些是流水线?
A: 按「是否运行时自主决策」划分:固定多步编排偏 Workflow;动态选工具/重试/反思偏 Agent。