导读
一句话结论:Transformer 是架构,LLM 是用它训练出的模型,Token 是模型读写的最小单位,Context 是模型一次能“看到”的全部 Token,Prompt 是你放进 Context 的指令;RAG、Tool、MCP、Skills 都是往 Context 里补充知识或能力的手段,Agent 是让 LLM 循环调用这些能力去完成任务的系统,Harness 则是承载并驱动 Agent 运行的外壳程序。
本报告逐一解释 11 个核心概念,补充长程记忆、RSI 及其他新技术,并说明它们如何拼成一个完整的 AI 应用。说明:原文中的“RGA”按业界通用术语理解为 RAG(Retrieval-Augmented Generation,检索增强生成)。
阅读建议:先看下一节的分层图建立全局印象,再按需阅读各概念详解,最后在“关系总结”中看一次真实请求如何串起所有概念。
全景:四层架构

自下而上读:模型层提供智能,交互层决定模型看到什么,扩展层往 Context 里补知识与能力,系统层让这一切循环运转。LLM 的输出(回答或工具调用请求)再交回 Agent,形成闭环。长程记忆是扩展层中唯一双向读写的一项;右侧虚线是 RSI 外循环,让 Agent 反过来改进模型、Skills 和 Harness 本身。每层标注的“新技术”在第 14 节逐项展开。
1. Transformer:一切的底层架构
Transformer 是 2017 年 Google 论文《Attention Is All You Need》提出的神经网络架构,它是几乎所有现代大模型的“蓝图”。它本身不是模型,而是一种模型结构。
核心机制:自注意力(Self-Attention)
- 处理每个词时,模型会计算它与序列中所有其他词的相关程度,再按权重融合信息。
- 例如“小明把苹果给了小红,因为她饿了”,注意力机制能让“她”更关注“小红”。
- 多头注意力(Multi-Head)让模型同时从语法、语义、指代等多个角度去“看”。
为什么它取代了 RNN/LSTM
| 对比项 | RNN / LSTM | Transformer |
|---|---|---|
| 计算方式 | 逐词串行 | 整句并行,适合 GPU |
| 长距离依赖 | 容易遗忘远处信息 | 任意两个词可直接关联 |
| 可扩展性 | 加大规模收益有限 | 参数和数据越多效果越好(Scaling Law) |
主要变体:编码器型(BERT,擅长理解)、解码器型(GPT、Claude、Llama,擅长生成)、编解码型(T5,擅长翻译、摘要)。今天的对话式大模型基本都是仅解码器(Decoder-only)结构。
与其他概念的关系:Transformer → 训练出 LLM;它的输入输出单位是 Token;注意力计算量随序列长度增长,这就是 Context 窗口有上限的根本原因。
2. LLM:用 Transformer 训练出的“大脑”
LLM(Large Language Model,大语言模型)是在海量文本上训练、参数规模达数十亿到万亿级的 Transformer 模型,如 Claude、GPT、Gemini、Llama、DeepSeek、Qwen。它的本质工作只有一件:根据已有的 Token,预测下一个最可能的 Token,然后不断重复。
典型训练流程
- 预训练(Pre-training):在互联网级文本上学习“预测下一个词”,获得语言和世界知识,得到“基座模型”。
- 指令微调(SFT):用“问题-优质回答”数据教它听懂指令、以对话形式回答。
- 对齐与强化学习(RLHF / RLAIF / RL):用偏好反馈和可验证任务(写代码、做数学)让它更有用、更安全、会推理、会调用工具。
能力与局限
| 擅长 | 天生局限 | 对应解决方案 |
|---|---|---|
| 理解、写作、翻译、编程、推理 | 知识有截止日期,不知道最新或私有信息 | RAG、联网搜索 Tool |
| 总结、归纳、生成结构化内容 | 可能“幻觉”:自信地编造事实 | RAG 提供依据、引用来源 |
| 根据指令灵活切换角色 | 只会输出文字,不能直接动手做事 | Tool、MCP、Agent |
| 单次上下文内的深度分析 | 本身无状态,每次调用都“失忆” | Context 管理、记忆文件、Harness |
关键认知:LLM 是一个无状态的函数——输入一串 Token,输出一串 Token。后面所有概念,都是围绕“如何组织输入、如何利用输出”展开的工程方法。
3. Token:模型读写的最小单位
Token 是 LLM 处理文本的基本单位,介于“字符”和“单词”之间。模型不直接看文字,而是先由分词器(Tokenizer)把文字切成 Token,再把每个 Token 映射成一个数字 ID 和一个向量(Embedding)。
分词示例(示意,不同模型切法不同)
unbelievable→un+believ+able(3 个 Token)人工智能→ 可能是 2–4 个 Token- 经验值(约数):英文 1 Token ≈ 0.75 个单词;中文 1 个汉字约 1–2 个 Token。
Token 为什么重要
| 维度 | 影响 |
|---|---|
| 计费 | API 按输入 Token + 输出 Token 分别计价,输出通常更贵 |
| 容量 | Context 窗口以 Token 计量,如 200K、1M Token |
| 速度 | 模型逐 Token 生成,输出越长耗时越久 |
| 能力边界 | 模型“看”的是 Token 而非字母,所以数字母、倒写单词这类任务反而容易出错 |
与其他概念的关系:Prompt、RAG 检索到的文档、Tool 的定义与返回结果、Skill 的说明——所有放进模型的东西最终都变成 Token,占用 Context、产生费用。Token 是整个体系的“货币”。
4. Context:模型的“工作记忆”
Context(上下文)是模型在一次推理中能看到的全部 Token,它的最大容量称为上下文窗口(Context Window)。模型没有真正的长期记忆,窗口外的信息对它而言等于不存在。
一次请求的 Context 通常包含
- System Prompt(系统提示:角色、规则、环境信息)
- Tool / MCP 工具的定义(名称、描述、参数格式)
- Skills 的简介列表(以及已加载的 Skill 正文)
- 记忆 / 项目说明(如 CLAUDE.md)
- 对话历史:用户消息、模型回复、工具调用与结果
- RAG 检索到的文档片段
- 当前这一轮的用户问题
上下文工程(Context Engineering)
随着应用变复杂,业界的关注点从“写好一句 Prompt”转向“管好整个 Context”:在有限的窗口里,在对的时机放入对的信息。常见手段:
- 按需加载:RAG 只取相关片段;Skills 只在用到时才读全文。
- 压缩摘要:对话过长时把旧内容总结成短摘要(Compaction)。
- 外部记忆:把重要信息写入文件或数据库,需要时再读回。
- 子智能体隔离:让子 Agent 在自己的 Context 里干重活,只把结论带回主线。
- 缓存:不变的前缀(系统提示、工具定义)使用 Prompt Caching,降低成本和延迟。
为什么不能无限塞:窗口有硬上限;内容越多越贵、越慢;并且无关信息会稀释注意力,降低回答质量。可以说,RAG、MCP、Skills、Harness 的很多设计,都是为了解决 Context 有限这一核心矛盾。
5. Prompt:告诉模型“做什么、怎么做”
Prompt(提示词)是人或程序写给模型的输入文本,是 Context 中最可控、最直接的部分。对于一个无状态的 LLM 来说,Prompt 就是它完成任务的全部依据。
三种角色的消息
| 类型 | 谁写 | 作用 |
|---|---|---|
| System Prompt(系统提示) | 开发者 / 产品 | 设定身份、行为规则、输出格式、可用能力,全局生效 |
| User Prompt(用户提示) | 最终用户 | 具体的问题或任务 |
| Assistant(模型回复) | 模型 | 历史回复也会作为后续轮次的输入 |
提示工程(Prompt Engineering)常用技巧
- 讲清背景与目的:说明为什么要做、给谁看,比堆砖规则更有效。
- 给出示例(Few-shot):用 2–3 个输入输出例子展示期望。
- 结构化:用 XML 标签或 Markdown 分隔指令、资料和问题。
- 让模型先思考:思维链(Chain-of-Thought)或开启扩展思考,提高复杂问题准确率。
- 指定格式:要求 JSON、表格等固定格式以便程序解析。
与其他概念的关系:Prompt 是“静态指令”;Skill 可以理解为“可按需加载的专业 Prompt 包”;Tool 和 MCP 的描述本质上也是写给模型看的 Prompt;Agent 的 System Prompt 定义了它的工作方式。
6. RAG:先查资料,再回答
RAG(Retrieval-Augmented Generation,检索增强生成)是在模型回答前,先从外部知识库检索相关资料,放进 Context,再让模型基于资料作答的技术。它相当于把“闭卷考试”变成“开卷考试”。
标准流程
- 索引(离线):把文档切成小块(Chunk),用 Embedding 模型转为向量,存入向量数据库。
- 检索(在线):把用户问题也转为向量,找出语义最接近的 Top-K 片段(常结合关键词检索、重排序 Rerank)。
- 增强:把片段拼进 Prompt:“请根据以下资料回答……”。
- 生成:LLM 基于资料作答,并可标注引用来源。
RAG 与微调(Fine-tuning)对比
| 对比项 | RAG | 微调 |
|---|---|---|
| 原理 | 不改模型,改输入 | 用数据继续训练,改模型参数 |
| 知识更新 | 更新文档即可,实时 | 需要重新训练 |
| 可追溯性 | 可给出引用来源 | 难以追溯 |
| 成本 | 低,工程为主 | 高,需算力和标注数据 |
| 适合 | 企业知识库问答、客服、文档助手 | 固定风格、特定格式、领域术语 |
演进趋势:传统 RAG 是“固定流程先检索再回答”;在 Agent 时代,检索变成了一个 Tool(如搜索、grep、读文件),由模型自己决定何时查、查什么、查几次,称为 Agentic RAG / Agentic Search。
7. Tool:让模型“动手”
Tool(工具,也叫 Function Calling / Tool Use)是开发者提供给模型、由外部程序执行的函数,例如搜索网页、查天气、读写文件、执行代码、查数据库。关键点:模型自己不执行工具,它只输出“我要调用哪个工具、参数是什么”,由外部程序真正执行。
一个工具的定义包含:名称(get_weather)、自然语言描述(告诉模型何时该用)、参数的 JSON Schema(如 city: string)。
调用流程
- 开发者把工具定义随请求一起发给模型(占用 Context)。
- 用户问:“上海明天要带伞吗?”
- 模型输出结构化请求:
get_weather({"city": "上海", "date": "明天"})。 - 应用程序执行该函数,把结果(“小雨,降水概率 80%”)作为工具结果返回给模型。
- 模型基于结果回答:“建议带伞。”
Tool 的价值:它让 LLM 从“只会说”变成“能做”——获取实时信息、精确计算、修改外部世界。
留下的问题:每个 AI 应用都要为每个外部系统(GitHub、Slack、数据库……)单独写一套工具对接代码,M 个应用 × N 个系统 = M×N 种集成。这正是 MCP 要解决的问题。
8. MCP:AI 世界的“USB-C 接口”
MCP(Model Context Protocol,模型上下文协议)是 Anthropic 于 2024 年 11 月开源的开放标准,规定了 AI 应用与外部工具、数据源之间的统一通信方式,现已被 OpenAI、Google、Microsoft 等主流厂商支持。它把 Tool 的对接从 M×N 变成 M+N:系统方写一次 MCP Server,所有支持 MCP 的 AI 应用都能直接使用。
三个角色
| 角色 | 是什么 | 例子 |
|---|---|---|
| Host(宿主) | 用户使用的 AI 应用 | Claude Desktop、Claude Code、Cursor |
| Client(客户端) | Host 内部与某个 Server 保持 1:1 连接的模块 | 由 Host 自动创建 |
| Server(服务端) | 封装某个系统能力的程序 | GitHub、Slack、Postgres、浏览器 MCP Server |
Server 能提供的三类能力
- Tools(工具):模型可调用的函数,如“创建 Issue”。
- Resources(资源):可读取的数据,如文件、数据库记录。
- Prompts(提示模板):预置的工作流模板。
传输方式有本地的 stdio 和远程的 HTTP(Streamable HTTP),消息格式基于 JSON-RPC 2.0。
要点辨析
- MCP 不是新的模型能力,而是 Tool 的标准化分发和连接方式。模型看到的仍然是普通的工具定义。
- 代价:每连接一个 Server,它的工具定义就占用一部分 Context。连太多会挤占空间,所以现代 Harness 会“延迟加载”工具定义。
- 安全:第三方 Server 返回的内容可能包含“提示注入”,应只接入可信的 Server。
9. Agent:会自己循环干活的 LLM
Agent(智能体)是让 LLM 在一个循环中自主决定下一步、调用工具、观察结果,直到完成目标的系统。一个常见的简洁定义是:Agent = LLM + 工具 + 循环。
Agent 循环(Agentic Loop)
- 感知:读取当前 Context(目标、历史、上一步工具结果)。
- 思考:规划接下来做什么。
- 行动:调用一个或多个 Tool。
- 观察:工具结果写回 Context。
- 重复 1–4,直到模型判断任务完成并给出最终回复(这也是经典的 ReAct 模式:Reason + Act)。
Agent 与普通聊天机器人、工作流的区别
| 形态 | 谁决定步骤 | 例子 |
|---|---|---|
| 聊天机器人 | 一问一答,没有步骤 | 早期 ChatGPT 网页版 |
| 工作流(Workflow) | 开发者写死的代码路径 | 固定的 RAG 问答管道 |
| Agent | 模型在运行中动态决定 | Claude Code 修 Bug、Deep Research 写报告 |
多智能体(Multi-Agent):主 Agent 把大任务拆分给多个子 Agent(Subagent),每个子 Agent 有独立的 Context 和专门的工具,并行工作后汇报结论。优势是并行和上下文隔离,代价是 Token 消耗成倍增长。
关键认知:Agent 的“智能”来自 LLM,“手脚”来自 Tool / MCP,“专业知识”来自 Skills 和 RAG,而“身体”——让循环真正跑起来的那个程序——就是 Harness。
10. Harness:驱动 Agent 运行的“外壳”
Harness(直译“马具/线束”,可译作“智能体运行框架”)是包裹在 LLM 外面、让它能作为 Agent 工作的那层程序。LLM 只是一个“输入 Token、输出 Token”的函数,Harness 负责其余的一切。同一个模型,换一个 Harness,表现可能天差地别。
Harness 的核心职责
| 职责 | 具体内容 |
|---|---|
| 驱动循环 | 调用模型 → 解析工具请求 → 执行 → 把结果送回,直到任务结束 |
| 组装 Context | 拼接 System Prompt、工具定义、Skills 列表、记忆、对话历史 |
| 管理 Context | 上下文快满时自动压缩、延迟加载工具、开启 Prompt 缓存 |
| 提供内置工具 | 读写文件、执行命令、搜索、浏览器、启动子 Agent |
| 接入扩展 | 连接 MCP Server、加载 Skills、插件 |
| 安全与权限 | 沙箱、权限审批(危险操作前询问用户)、Hooks |
| 交互界面 | 终端、桌面应用、IDE 插件、网页 |
典型例子:Claude Code(以及其底层的 Claude Agent SDK)、Cursor、OpenAI Codex CLI、Gemini CLI。你现在正在使用的 Claude Code 桌面端,就是一个 Harness:它把 Claude 模型与文件系统、终端、浏览器、MCP 连接器、Skills 组装在一起。
一个形象的比喻:LLM 是发动机,Harness 是整辆车的底盘、方向盘和刹车系统。发动机决定动力上限,底盘决定这份动力能否安全、高效地转化为前进。
11. Skills:按需加载的“专业技能包”
Skills(Agent Skills)是 Anthropic 于 2025 年 10 月推出、后成为开放标准的机制:把某类任务的专业知识、操作步骤、脚本和模板打包成一个文件夹,Agent 在需要时自动加载。如果说 Tool 给了 Agent “手”,Skill 就是给了它一本“操作手册”。
结构:每个 Skill 是一个文件夹,核心是 SKILL.md(开头是名称 + 一句话描述,正文是详细指南),还可附带参考文档、Python 脚本、模板文件。例如处理 PDF、生成 Excel/PPT、按公司规范写周报。
核心设计:渐进式披露(Progressive Disclosure)
- 第一层:平时 Context 里只放每个 Skill 的名称和一句话描述(每个约几十 Token)。
- 第二层:模型判断任务相关时,才读入
SKILL.md全文。 - 第三层:正文中引用的脚本和参考文档,用到时再读或直接执行。
这样可以安装几十上百个 Skill,却几乎不占用 Context——正是上下文工程的典型实践。
Skills / Tool / MCP / Prompt 辨析
| 概念 | 提供什么 | 以什么形式 | 何时进入 Context |
|---|---|---|---|
| Prompt | 一次性指令 | 文字 | 始终在 |
| Tool | 一个可执行的动作 | 函数 + Schema | 定义通常始终在 |
| MCP | 一组标准化接入的外部工具和数据 | 独立运行的 Server | 连接后,工具定义进入 |
| Skill | “怎么做好某类事”的方法论 | 文件夹(说明 + 脚本 + 资料) | 按需加载 |
一句话区分:MCP 解决“能连上什么”,Skill 解决“知道怎么做”,二者互补。例如 MCP 让 Agent 能读写你的 Notion,Skill 告诉它你们公司的需求文档应该怎么写。
12. 长程记忆:让“失忆”的 LLM 跨会话记住事情
位置:长程记忆位于扩展层,是一个由 Harness 管理的外部存储;它在会话结束时把重要信息写出 Context,在新会话开始时再把相关部分读回 Context。 LLM 本身是无状态的,Context 只是“工作记忆”;长程记忆弥补的是“关掉窗口就忘光”这个缺口。
记忆的三种形态
| 形态 | 存在哪里 | 持续多久 | 怎么更新 | 例子 |
|---|---|---|---|---|
| 参数记忆 | 模型权重 | 直到模型更新 | 预训练 / 微调 | “巴黎是法国首都” |
| 工作记忆(短期) | Context 窗口 | 本次会话 | 对话自动累积,满了就压缩 | 刚才读过的文件 |
| 外部记忆(长程) | 文件、数据库、向量库 | 跨会话、可永久 | Agent 主动写入 / 整理 | 用户偏好、项目规范、上次进度 |
长程记忆的存取流程
- 写入:Agent 在对话中发现值得记住的事(用户纠正、偏好、项目决策),调用“记忆工具”写入外部存储。
- 整理:定期合并重复、删掉过时信息,防止记忆膨胀或自相矛盾。
- 召回:新会话开始时,Harness 把记忆索引放入 Context;细节按需读取(与 RAG 和 Skills 的渐进式加载同理)。
常见实现
- 文件式记忆:Claude Code 的 CLAUDE.md 与记忆目录、ChatGPT 和 Claude 的“记忆”功能。简单、可读、用户可直接编辑。
- 向量 / 知识图谱记忆:如 Mem0、Letta(原 MemGPT)等框架,适合海量、非结构化的历史。
- 通过 MCP 接入:记忆库可以做成一个 MCP Server,让多个 Agent 共享。
与 RAG 的区别:两者技术很像(都是“存起来、用时取”),但 RAG 的资料来自外部、通常只读;长程记忆的内容来自 Agent 自己的经历,由 Agent 读写。一句话:RAG 是查公司档案,记忆是写自己的工作笔记。
13. RSI:递归自我改进
位置:RSI 不属于四层中的任何一层,而是套在整个架构外面的一个“外循环”:系统层的 Agent 反过来去改进模型层(训练更强的 LLM)和扩展层(写更好的 Skill、工具和 Harness),更强的系统再去做下一轮改进。
RSI(Recursive Self-Improvement,递归自我改进)指 AI 系统能提升自身能力,而提升后的系统又更擅长继续提升自己,形成正反馈。Agent 循环解决的是“完成一个任务”,RSI 循环解决的是“让自己变得更强”。
从弱到强的三个层次
| 层次 | 改进的对象 | 是否改权重 | 今天的状态 |
|---|---|---|---|
| 上下文级 | Prompt、记忆、Skills、工具 | 否 | 已普遍可用:Agent 自己写 Skill、整理记忆、优化 Prompt |
| 训练级 | 训练数据、奖励信号、训练代码 | 是,由人把关 | 正在发生:模型生成合成数据、当评审、写训练代码和实验 |
| 全自动 | 模型自主设计并训练下一代自己 | 是,无人工介入 | 尚未实现,是前沿实验室重点监测的风险点 |
今天已经能看到的雏形
- 自我对弈与强化学习:AlphaGo Zero 通过和自己下棋变强;推理模型在可验证任务(数学、代码)上用自己生成的解答训练。
- AI 评审 AI:RLAIF、Constitutional AI 等方法让模型代替部分人工标注。
- AI 写 AI 的代码:编程 Agent 已大量参与大模型公司自己的研发代码。
- Agent 自我完善:Agent 用 skill-creator 一类工具编写和评测自己的 Skill,并把经验写入长程记忆。
为什么重要:如果 RSI 闭环跑通,能力增长可能远快于人类研发的节奏。因此各大实验室的安全框架(如 Anthropic 的 Responsible Scaling Policy)都把“自主 AI 研发能力”列为需要特别评估和防护的能力阈值。对普通开发者来说,可落地的是第一层:让 Agent 从每次任务中沉淀记忆和 Skill,越用越顺手。
14. 其他值得加入的新技术
这些技术大多不是新的一层,而是在原有四层里继续加深:模型层变得更会思考、更高效,扩展层从“调 API”扩展到“操作电脑”,系统层从单个 Agent 走向 Agent 网络。
| 技术 | 一句话解释 | 所在层 | 与已有概念的关系 |
|---|---|---|---|
| 推理模型 / 扩展思考 | 回答前先生成一段长思考,用推理时的算力换准确率(Test-time Compute) | 模型层 | 思考过程也是 Token,占用 Context 和费用 |
| MoE 混合专家 | 模型内部有很多“专家”子网络,每个 Token 只激活少数几个 | 模型层 | Transformer 的一种变体,让大模型更便宜、更快 |
| 多模态 | 同一个模型能看图、听音频、读 PDF、生成图像和语音 | 模型层 | 图片和音频也被切成 Token 放进 Context |
| 蒸馏与小模型 | 用大模型教小模型,小模型可在手机或本地运行 | 模型层 | 常作为子 Agent 或路由模型,降低成本 |
| 上下文压缩与 Prompt 缓存 | 自动总结旧对话、复用不变的前缀 | 交互层 | 上下文工程的核心手段,由 Harness 实现 |
| Computer Use / Browser Use | 模型看屏幕截图、点击鼠标、敲键盘,像人一样操作软件 | 扩展层 | 一类特殊的 Tool,用于没有 API 的场景 |
| 代码执行沙箱 | 给 Agent 一个隔离的虚拟机去运行代码、处理文件 | 扩展层 | Skills 里的脚本在这里执行;也是安全边界 |
| A2A 等 Agent 间协议 | 不同厂商的 Agent 之间互相发现、委托任务 | 系统层 | MCP 连接“Agent 与工具”,A2A 连接“Agent 与 Agent” |
| 多智能体编排 | 主 Agent 拆任务、派子 Agent 并行干活 | 系统层 | Harness 的能力;用上下文隔离换并行度 |
| Hooks 与护栏 | 在工具调用前后自动运行检查脚本、拦截危险操作 | 系统层 | Harness 的安全与权限机制 |
| 评测(Evals)与可观测性 | 用测试集和调用日志衡量 Agent 做得对不对、花了多少 Token | 跨层 | RSI 的前提:没有可靠的评测就无法判断“改进” |
| Agentic RL 与训练环境 | 在模拟环境里让模型反复完成多步任务并按结果奖励 | 模型层 ↔ 系统层 | 把 Agent 循环反哺给训练,是训练级 RSI 的主要路径 |
14.1 模型层:更会思考、更高效、能看能听
推理模型 / 扩展思考(Reasoning Models / Extended Thinking)
- 是什么:模型在给出答案前,先生成一段较长的内部思考:拆解问题、尝试思路、自我检查、发现错误后回退。代表有 OpenAI o 系列、DeepSeek-R1、Claude 的扩展思考。
- 原理:通过强化学习在数学、编程等可验证的任务上训练,答对了就奖励,模型自己学会“多想一会儿”。这开启了新的扩展方向:除了加大训练规模,还可以增加推理时的算力(Test-time Compute)。
- 代价:思考过程也是 Token,会占用 Context、增加费用和延迟。简单问题应低思考量,复杂问题才开高思考量。
- 对 Agent 的意义:更强的规划和纠错能力,是长任务 Agent 能工作数小时而不跑偏的基础。
MoE 混合专家(Mixture of Experts)
- 是什么:把 Transformer 中的前馈层拆成许多个“专家”子网络,由一个“路由器”为每个 Token 挑选少数几个专家参与计算。
- 好处:总参数量很大(知识容量大),但每个 Token 只激活小部分参数(计算量小),用更低成本获得大模型的效果。DeepSeek-V3、Mixtral、Qwen 的 MoE 版本都采用这种结构。
- 理解要点:MoE 中的“专家”是内部的数学结构,并不对应“数学专家”“代码专家”这样的人类分工;与多智能体是完全不同的概念。
多模态(Multimodal)
- 是什么:同一个模型能处理文字以外的输入和输出:看图片和截图、读 PDF 和图表、听和说语音、生成图像或视频。
- 原理:图片、音频被切成小块,转换成与文字 Token 同一空间的向量,一起放进 Context。所以一张图也会消耗数百到上千个 Token。
- 对 Agent 的意义:多模态是 Computer Use 的前提——模型必须“看得懂”屏幕截图才能操作电脑。
蒸馏与小模型(Distillation / SLM)
- 是什么:用大模型(教师)的输出去训练小模型(学生),让小模型在特定任务上接近大模型的水平。
- 好处:更快、更便宜,可以在手机、笔记本电脑上本地运行,数据不出设备。
- 在架构中的用法:常见的做法是“大小模型搭配”——大模型做主 Agent 负责规划,小模型做子 Agent 或路由器,处理大量简单任务,降低整体成本。
14.2 交互层:把有限的 Context 用得更久、更便宜
上下文压缩(Compaction)
- 是什么:当对话接近 Context 上限时,Harness 让模型把前面的内容总结成一份精简摘要,用摘要替换原始历史,对话就能继续下去。
- 类似手段:清除旧的工具返回结果(保留“调用了什么”,丢掉大段输出)、把长内容写进文件只在 Context 里留路径。
- 意义:让 Agent 能连续工作数小时,超过单个窗口的容量。与长程记忆配合使用:压缩会丢失细节,重要信息应先写入记忆。
Prompt 缓存(Prompt Caching)
- 是什么:每次请求都会重发 System Prompt、工具定义和对话历史。如果这些前缀没变,服务端可以复用上次的计算结果,不必重算。
- 好处:命中缓存的部分费用大幅降低、响应更快;对工具调用频繁的 Agent 尤其关键——一个任务可能要请求模型几十上百次。
- 设计启示:把不变的内容放在前面、变化的内容放在后面,并尽量避免中途修改工具列表。这也是为什么很多 Harness 采用“延迟加载工具”而不是动态修改工具定义。
14.3 扩展层:从“调 API”到“操作电脑”
Computer Use / Browser Use(电脑与浏览器操作)
- 是什么:模型通过截图“看”屏幕,再输出鼠标点击、键盘输入、滚动等动作,由 Harness 在真实的桌面或浏览器中执行。代表有 Claude Computer Use、OpenAI 的 Operator / ChatGPT Agent,以及各类浏览器 Agent。
- 和普通 Tool 的区别:普通 Tool 要求对方系统提供 API;Computer Use 把“整台电脑”当作一个工具,可以操作没有 API 的老系统、网页表单和桌面软件。
- 局限:比调 API 慢、更耗 Token(每步都要截图)、更容易出错。经验法则:有 API 就用 Tool / MCP,没有 API 才用 Computer Use。
- 安全:网页内容可能包含针对 AI 的“提示注入”,涉及登录、支付、发送消息的操作应由人确认。
代码执行沙箱(Code Execution Sandbox)
- 是什么:给 Agent 一个隔离的虚拟机或容器,可以自由运行 Python / Shell、安装依赖、读写文件、生成图表和文档,不会影响主机。
- 为什么重要:“写代码并运行”是最通用的工具——一个沙箱可以替代成百个专用工具。精确计算、数据分析、文件格式转换都靠它。
- 与 Skills 的关系:Skill 中附带的脚本就是在沙箱里执行的。Skill 提供“方法”,沙箱提供“运行场所”。
- 与安全的关系:沙箱是 Agent 的主要安全边界,限制它能访问的文件、网络和凭证。
14.4 系统层:从单个 Agent 到 Agent 团队
A2A 等 Agent 间协议(Agent-to-Agent)
- 是什么:Google 于 2025 年发起、后捐给 Linux 基金会的开放协议,让不同厂商、不同框架构建的 Agent 能互相发现对方的能力(通过“Agent Card”)、委托任务、同步进度。
- 和 MCP 的分工:MCP 连接的是 Agent 与工具(工具是被动的,调用即返回);A2A 连接的是 Agent 与 Agent(对方是主动的,可能要工作很久、中途提问)。两者互补。
- 场景:企业的招聘 Agent 把“安排面试”委托给另一家供应商的日程 Agent。
多智能体编排(Multi-Agent Orchestration)
- 是什么:主 Agent(Orchestrator)把大任务拆成子任务,分派给多个子 Agent 并行执行,再汇总结果。常见模式:主从模式、流水线、“做事 + 审查”互相检查。
- 好处:并行提速;每个子 Agent 有独立 Context,主线不会被大量中间结果撑爆;不同子 Agent 可配置不同工具和模型。
- 代价:Token 消耗成倍增长,协调不好会重复劳动或结论冲突。适合可以拆开并行的宽广任务(如大规模调研),不适合步步依赖的任务。
Hooks 与护栏(Guardrails)
- 是什么:Hooks 是 Harness 在特定事件(工具调用前后、任务结束时)自动运行的脚本;护栏是对输入输出的规则检查。
- 典型用法:禁止删除关键目录、改代码后自动格式化和跑测试、输出前过滤敏感信息、记录审计日志。
- 关键区别:写在 Prompt 里的规则模型“可能”会遵守;Hooks 是确定性的代码,“一定”会执行。必须保证的事情用 Hooks,建议性的事情用 Prompt。
14.5 跨层:衡量好坏,并把经验反哺给模型
评测(Evals)与可观测性(Observability)
- Evals 是什么:一组有标准答案或评分规则的测试任务,用来衡量模型或 Agent 做得对不对。评分方式可以是代码自动判定、另一个模型打分(LLM-as-Judge),或人工评审。公开基准如 SWE-bench(修真实代码 Bug)、τ-bench(客服工具使用)、OSWorld(操作电脑)。
- 可观测性是什么:记录 Agent 每一步的输入、工具调用、耗时和 Token 消耗(Tracing),出问题时能回放整个过程。
- 为什么重要:Agent 的行为每次都可能不同,没有 Evals 就无法知道改了 Prompt、换了模型、加了 Skill 之后是变好还是变差。Evals 是所有“改进”的前提,包括 RSI。
Agentic RL 与训练环境(RL Environments)
- 是什么:为模型搭建模拟的工作环境(代码仓库、网站、办公软件、客服系统),让它在里面以 Agent 的方式反复完成多步任务,按最终结果给奖励,用强化学习更新权重。
- 和传统训练的区别:预训练教模型“说得像人”,Agentic RL 教模型“把事情做成”——会规划、会用工具、会从失败中恢复。今天编程 Agent 能力的快速提升,很大程度上来自这种训练。
- 在架构中的位置:它把系统层的 Agent 循环“反哺”给模型层,正是 RSI 训练级外循环的具体实现。它与 Evals 密不可分:奖励信号本质上就是一套自动化的评测。
如果只挑三个先学:推理模型(决定今天模型能力的上限)、Computer Use(决定 Agent 能触及的范围)、Evals(决定你能否判断系统是否变好)。
关系总结
这些概念可以用“一家公司里的一位新员工”来类比:模型是员工的大脑,其余概念分别是它的工作台、资料、工具、手册和办公环境。
| 概念 | 一句话定义 | 所在层 | 公司类比 |
|---|---|---|---|
| Transformer | 基于自注意力的神经网络架构 | 模型层 | 大脑的生理结构 |
| LLM | 用 Transformer 在海量文本上训练的模型 | 模型层 | 一位博学但失忆的新员工 |
| Token | 模型读写和计费的最小单位 | 模型层 | 员工读写的字词 |
| Context | 模型一次能看到的全部 Token | 交互层 | 员工的办公桌面,大小有限 |
| Prompt | 写给模型的指令 | 交互层 | 领导交代的任务说明 |
| RAG | 先检索资料再作答 | 扩展层 | 先去资料室查档案 |
| Tool | 模型可请求执行的外部函数 | 扩展层 | 电脑、电话等办公工具 |
| MCP | 连接外部工具的统一协议 | 扩展层 | 统一插座标准,任何设备即插即用 |
| Skills | 按需加载的专业方法包 | 扩展层 | 岗位操作手册,用时才翻 |
| 长程记忆 | 跨会话保存、由 Agent 读写的外部存储 | 扩展层 | 员工自己的工作笔记本 |
| Agent | LLM + 工具 + 循环,自主完成任务 | 系统层 | 能独立负责项目的员工 |
| Harness | 驱动 Agent 运行的外壳程序 | 系统层 | 公司的办公环境与管理制度 |
| RSI | 系统改进自身、越改越会改的正反馈 | 外循环 | 员工总结经验、改进流程,甚至参与培训下一代员工 |
一次完整请求的端到端流程
以“帮我汇总本周 GitHub 上的 Issue,按团队规范写周报”为例:

- 用户提问:这句话就是 User Prompt。
- Harness 组装 Context:System Prompt + GitHub MCP 的工具定义 + “周报”Skill 的简介 + 历史对话 + 用户问题,全部切成 Token 送入 LLM。
- LLM 推理:基于 Transformer 的模型判断“我需要先拿到 Issue 数据,并看看周报规范”。
- Harness 执行:调用 GitHub MCP Server 的工具取回 Issue 列表,并加载周报 Skill 全文;结果写回 Context,再让 LLM 推理一轮——这就是 Agent 循环,可能重复多次。如果需要查公司内部文档,还可能触发 RAG 检索。
- 最终回答:信息足够后,LLM 按 Skill 规定的格式生成周报,循环结束。
三条关系主线
- 从下到上的依赖:Transformer → LLM → 处理 Token → 受限于 Context。
- 往 Context 里放什么:Prompt(指令)、RAG(知识)、Tool / MCP(能力与结果)、Skills(方法)。
- 谁来驱动:Agent 是行为模式(循环决策),Harness 是实现这种模式的具体程序。
结论与学习路径
核心结论:这 11 个概念围绕一条主线展开——LLM 很聪明,但只能看到 Context 里的 Token;其余所有技术都在解决“往有限的 Context 里放什么、放进去后如何行动”。
- 模型层(Transformer、LLM、Token)决定能力上限,普通开发者一般直接选用,不自己训练。
- 交互层(Context、Prompt)决定这份能力能发挥出多少,是投入产出比最高的环节。
- 扩展层(RAG、Tool、MCP、Skills、长程记忆)分别补知识、补行动、补连接、补方法论、补经验。
- 系统层(Agent、Harness)把一切串成能自主完成任务的产品。
- 外循环(RSI)让系统反过来改进各层:今天主要发生在记忆和 Skills 层面,训练层面仍由人把关。
- 新技术在每层继续加深:模型层更会思考(推理模型、MoE、多模态),交互层更省(压缩、缓存),扩展层能操作电脑(Computer Use、沙箱),系统层走向 Agent 协作(A2A、多智能体、Hooks);Evals 和 Agentic RL 把各层串成 RSI 外循环。
建议学习路径
- 用好现有产品:在 Claude / ChatGPT 中练习写清晰的 Prompt,体会 Context 的作用。
- 调用 API:写一个最小程序调用模型,观察 Token 计费和 System Prompt 的效果。
- 加上 Tool:实现一个天气或计算器工具,理解“模型提议、程序执行”的分工。
- 做一个 RAG:用自己的文档搭一个问答助手。
- 使用 Harness:在 Claude Code 中接入一个 MCP Server,并编写一个自己的 Skill。
- 构建 Agent:用 Claude Agent SDK 等框架做一个能多步完成任务的小 Agent。
- 有余力再深入 Transformer 原理(推荐先读《Attention Is All You Need》的图解类文章)。