Agent八股

LLM

上下文窗口

一次调用能够容纳的 Token 上限

上下文的组成部分:

组成部分 包含内容
系统级指令 平台规则、安全规则、模型行为边界等。通常由平台注入,用户不一定可见
开发者指令 应用设定的角色、任务要求、输出格式、处理流程、风格等
工具定义 可调用工具的名称、用途、参数说明、JSON Schema,以及工具选择约束
历史对话 之前的用户消息、助手回答,以及保留下来的其他会话项目
当前用户输入 当前问题、附件、图片、文件以及结构化输入
工具调用历史 助手之前发起的函数调用、调用参数,以及工具返回的结果
检索或外部资料 RAG 检索片段、网页搜索结果、数据库记录、文件搜索结果等,但前提是应用把它们注入上下文
压缩摘要或记忆 长对话经过压缩后形成的摘要,以及应用主动取出的用户偏好或长期记忆
推理状态项 某些推理模型和 Responses API 工作流中,为保持多轮连续性而传递的 reasoning items;不等同于向用户公开完整思维过程

Agent

什么是Agent

可以理解为一个能感知环境、做决策、执行动作的软件系统。和普通聊天机器人的差别在于:Agent 不只是回复消息,它会在动态环境里持续观察、判断、执行,直到任务结束

Agent = LLM + Planning + Memory + Tools

  • Planning:LLM分析当前任务状态,拆目标,决定下一步怎么做
  • Tools:让LLM能操作外部世界,如查数据、调 API、读文件、执行代码
  • Agent Loop:不断循环让 LLM 推理、调用工具、把工具结果写回上下文,直到任务完成或触发停止条件

设计思想

  • ReAct:Reasoning + Acting。模型先推理一步,拿到外部环境反馈,再推理下一步,交替进行
    • 优点:减少幻觉,复杂任务成功率高
    • 缺点:多轮迭代增加延迟,效果依赖Tools和Skills质量
  • Plan-and-Execute:先让 LLM 制定全局分步计划,再由执行器按步骤完成
    • 优点:适合步骤多、依赖关系明确的长期任务,不容易在长任务中迷路
    • 缺点:动态调整会弱一些

Memory

功能类型 核心问题 存储内容 典型场景
事实记忆 智能体知道什么 用户偏好、环境状态、显式事实 记住用户的技术栈偏好
经验记忆 智能体如何改进 过往轨迹、成败教训、策略知识 从失败的代码审查中学习
工作记忆 智能体当前思考什么 当前推理上下文、任务进展 多步推理中的中间状态

Skills

把某类任务的经验、约束和执行顺序沉淀下来,让 Agent 在需要时再读

RAG

Retrieval-Augmented Generation,检索增强生成,系统先从知识库里检索出和当前问题相关的片段,知识库可以是数据库、文档集合,也可以是企业内部系统。然后把这些片段和原始问题一起喂给 LLM,让模型基于检索内容回答,而不是只靠训练时记住的知识

AI编程


Agent八股
http://xwww12.github.io/2026/08/24/八股/Agent八股/
作者
xw
发布于
2026年8月24日
许可协议