跳转到内容

9:初识智能体 Agent

机器学习Banner

🤖 从”会聊天”到”会做事”——LLM Agent 入门

Section titled “🤖 从”会聊天”到”会做事”——LLM Agent 入门”

经过前八题,你已经从线性回归一路走到了 Transformer,理解了深度学习与大模型的底层原理。但你会发现,直接问一个大模型问题,它只会”回答”,不会”做事”:它不能帮你查资料、订机票、操作软件。而 Agent(智能体) 正是让大模型从”会聊天”走向”会做事”的关键技术。

这一题我们有意不做得复杂,不要求你从零手写模型。我们的目标是:

  1. 让你理解 Agent 的核心概念
  2. 教会你如何检索论文、阅读论文——这是所有后续科研工作的基本功
  3. 通过精读 1~2 篇论文,写出你自己的心得与收获

提示:这一题最重要的产出不是代码,而是你的思考过程和阅读记录。请务必独立完成,不要依赖 AI 代写。


请先用自己的话回答以下问题,为论文阅读建立”背景知识”。

  • 什么是 AI Agent?它与普通的”问答式”大模型应用(比如直接向 ChatGPT 提问)有什么本质区别?
  • 如何理解”感知(Perception)→ 规划(Planning)→ 行动(Action)“这个循环?
  • 在 LLM 出现之前,Agent 概念已经存在(如强化学习智能体)。LLM 给 Agent 带来了哪些新能力?

目前主流观点认为 Agent 通常具备以下能力,请逐一解释:

  • 规划(Planning):什么是任务分解?什么是反思与自我纠正?
  • 记忆(Memory):短期记忆与长期记忆分别指什么?实现上可以借助哪些技术?
  • 工具使用(Tool Use):什么是工具调用(Tool Calling / Function Calling)?为什么工具对 Agent 如此重要?
  • 行动(Action):Agent 如何与环境交互、观察反馈并调整下一步?
  • 什么是 ReAct 模式(Reasoning + Acting)?它与 Chain-of-Thought(思维链)有什么区别?
  • 什么是多智能体系统(Multi-Agent)?多个 Agent 协作相比单个 Agent 有什么优势与代价?
  • 你了解哪些 Agent 框架或项目(如 LangChain、AutoGPT、BabyAGI、MetaGPT、Generative Agents)?任选一个简单介绍它的设计思路。
  • RAG(检索增强生成)与 Agent 是什么关系?Agent 的”记忆”与 RAG 有何联系和区别?
  • 任选一个 Agent 应用场景(编程助手、自动科研、游戏 NPC、浏览器操作、智能客服等),谈谈它的价值与目前面临的挑战。

这一部分是本题的”重点教学”。请认真阅读,并把它当作你完成 Part 3 的操作手册。

平台用途地址
arXivAI 领域论文预印本平台,新工作几乎第一时间发布https://arxiv.org
Google Scholar学术搜索引擎,可查看引用量与被引关系https://scholar.google.com
Semantic Scholar语义搜索,能查”引用了谁 / 被谁引用”,按影响力排序https://www.semanticscholar.org
Papers with Code论文 + 开源代码 + 结果排行榜,方便复现和对比https://paperswithcode.com
ACL AnthologyNLP 方向论文官方库(ACL / EMNLP / NAACL 等)https://aclanthology.org
Hugging Face Papers每日精选论文与社区讨论https://huggingface.co/papers
中文社区知乎、机器之心、PaperWeekly、B 站论文讲解搜索关键词即可

搜索技巧

  • 关键词组合:LLM agent surveylarge language model agentReAct reasoning actingmulti-agent framework
  • 限定站点:site:arxiv.org agentsite:aclanthology.org agent
  • 时间限定:优先看近两年的工作;搜索时先看标题和摘要,把候选论文列成清单,再逐个决定是否精读。

2.2 如何判断一篇论文”值得读”

Section titled “2.2 如何判断一篇论文”值得读””
  • 从综述(Survey)入手:先读 Agent 方向的综述,能快速建立”领域地图”,综述里会引用大量经典论文。例如 The Rise and Potential of Large Language Model Based Agents: A Survey(arXiv 2023)。
  • 顺藤摸瓜(引用追踪)
    • 向前追踪:这篇论文引用了哪些工作(基础)?
    • 向后追踪:谁引用了这篇论文(后续改进)?
  • 看发表渠道:顶会论文(NeurIPS、ICML、ICLR、ACL、EMNLP、AAAI)经过严格评审,质量更有保障。
  • 看团队与代码:知名机构的工作可信度更高;有开源代码的论文更容易复现和学习。

2.3 如何阅读一篇论文:“三遍阅读法”

Section titled “2.3 如何阅读一篇论文:“三遍阅读法””

推荐使用计算机科学家 S. Keshav 提出的三遍阅读法:

  • 第一遍:泛读(5~10 分钟)。只读标题、摘要、引言、结论和图表标题,回答三个问题:这篇论文解决什么问题?方法大致是什么?效果如何?据此决定是否继续。
  • 第二遍:精读(约 1 小时)。通读全文,重点理解方法部分和实验部分;看懂每一张图;把不懂的地方标记出来;合上论文,尝试向自己复述论文的核心思想。
  • 第三遍:批判性阅读。思考:方法有什么局限?假设是否合理?换作你会怎么做?这篇论文能给你自己的项目带来什么启发?

阅读建议

  • 边读边记,不要”只读不写”。用 Part 3 的论文卡片记录,或在原文上做批注。
  • 遇到不懂的概念(如 RAG、Function Calling、思维链),可以先用 AI 工具查清楚,再回到论文里。
  • 第一次读不懂很正常,先抓住”解决的问题”和”核心思想”,细节可以之后回看。

2.4 Agent 方向推荐论文清单(按易到难排序)

Section titled “2.4 Agent 方向推荐论文清单(按易到难排序)”

从以下清单中任选 1~2 篇精读(也可以自选,但需说明选择理由):

  1. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models(NeurIPS 2022)——思维链,推理能力的基础
  2. ReAct: Synergizing Reasoning and Acting in Language Models(ICLR 2023)——Agent 范式开山之作,强烈推荐
  3. Toolformer: Language Models Can Teach Themselves to Use Tools(NeurIPS 2023)——模型如何学会用工具
  4. Tree of Thoughts: Deliberate Problem Solving with Large Language Models(NeurIPS 2023)——更强大的搜索式推理
  5. Reflexion: Language Agents with Verbal Reinforcement Learning(NeurIPS 2023)——自我反思与纠错
  6. Generative Agents: Interactive Simulacra of Human Behavior(UIST 2023)——记忆系统与”模拟人生”
  7. MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework(ICLR 2024)——多智能体协作
  8. The Rise and Potential of Large Language Model Based Agents: A Survey(arXiv 2023)——综述,建立全局观
  9. 开源项目 AutoGPT / BabyAGI(非论文)——最早的自主 Agent 演示,可当科普读物

  1. 使用 Part 2 的方法完成检索,记录你的检索过程(见下)。
  2. 精读 1~2 篇论文,填写”论文阅读卡片”。
  3. 将结果整理进报告。

3.1 检索过程记录(请如实填写)

Section titled “3.1 检索过程记录(请如实填写)”
- 检索平台:______(如 arXiv / Google Scholar / Semantic Scholar)
- 检索关键词:______
- 浏览过的论文标题(至少列 3 篇):______
- 最终选择的论文:______
- 选择理由(如:经典之作 / 我对这个话题感兴趣 / 有开源代码):______
## 论文阅读卡片
**基本信息**
- 标题(中英文):
- 作者 / 机构:
- 发表会议 / 期刊 / arXiv 编号:
- 论文链接:
**1. 这篇论文解决了什么问题?**
- 研究背景与动机:
- 要解决的核心问题:
**2. 核心方法(用自己的话概括,不超过 200 字)**
- 方法的核心思想:
- 关键技术与流程:
**3. 实验与结论**
- 使用的数据集 / 任务:
- 主要实验结果:
- 论文的贡献:
**4. 局限与思考**
- 论文的局限:
- 如果让我改进,我会:
- 对"Agent 是什么、如何构建"的启发:
**5. 收获与心得(不少于 300 字)**
- 阅读前我对 Agent 的理解:
- 阅读后我的理解发生了什么变化:
- 我打算如何把论文中的思想用到实践中:

  1. 有人说”大模型是大脑,Agent 是躯体,工具是四肢”,你如何理解这句话?是否同意?
  2. 目前 Agent 还存在哪些明显的问题?(提示:幻觉、推理成本、长任务失败率、安全与对齐……)
  3. 如果让你设计一个面向校园场景的 Agent(例如”课程助教 Agent”),你会为它配备哪些工具与记忆能力?请简要描述你的设计。

与前几题保持一致:鼓励使用 AI 辅助学习,但请注意:

  1. 简答题与心得必须用自己的语言组织,禁止直接复制粘贴
  2. 论文卡片应基于真实的阅读过程,不能只靠摘要或 AI 总结拼凑
  3. 在报告中注明你使用了哪些 AI 帮助(如解释概念、协助检索)
  • 文档报告:Part 1 简答题 + Part 2 的检索过程记录 + Part 3 论文卡片 + Part 4 思考题,写入 .md 文件,命名格式:ml-9-姓名-学号.md

  • 将文件压缩为 ml-9-姓名-学号.zip 提交

  • 邮箱: glimmerml401@163.com

  • 主题: 9-姓名-学号

出题人:出题人头像  Taffy

QQ:2078306188

邮箱:2078306188@qq.com