导读

一句话结论:Transformer 是架构,LLM 是用它训练出的模型,Token 是模型读写的最小单位,Context 是模型一次能“看到”的全部 Token,Prompt 是你放进 Context 的指令;RAG、Tool、MCP、Skills 都是往 Context 里补充知识或能力的手段,Agent 是让 LLM 循环调用这些能力去完成任务的系统,Harness 则是承载并驱动 Agent 运行的外壳程序。

本报告逐一解释 11 个核心概念,补充长程记忆、RSI 及其他新技术,并说明它们如何拼成一个完整的 AI 应用。说明:原文中的“RGA”按业界通用术语理解为 RAG(Retrieval-Augmented Generation,检索增强生成)。

阅读建议:先看下一节的分层图建立全局印象,再按需阅读各概念详解,最后在“关系总结”中看一次真实请求如何串起所有概念。

全景:四层架构

自下而上读:模型层提供智能,交互层决定模型看到什么,扩展层往 Context 里补知识与能力,系统层让这一切循环运转。LLM 的输出(回答或工具调用请求)再交回 Agent,形成闭环。长程记忆是扩展层中唯一双向读写的一项;右侧虚线是 RSI 外循环,让 Agent 反过来改进模型、Skills 和 Harness 本身。每层标注的“新技术”在第 14 节逐项展开。

1. Transformer:一切的底层架构

Transformer 是 2017 年 Google 论文《Attention Is All You Need》提出的神经网络架构,它是几乎所有现代大模型的“蓝图”。它本身不是模型,而是一种模型结构。

核心机制:自注意力(Self-Attention)

  • 处理每个词时,模型会计算它与序列中所有其他词的相关程度,再按权重融合信息。
  • 例如“小明把苹果给了小红,因为她饿了”,注意力机制能让“她”更关注“小红”。
  • 多头注意力(Multi-Head)让模型同时从语法、语义、指代等多个角度去“看”。

为什么它取代了 RNN/LSTM

对比项RNN / LSTMTransformer
计算方式逐词串行整句并行,适合 GPU
长距离依赖容易遗忘远处信息任意两个词可直接关联
可扩展性加大规模收益有限参数和数据越多效果越好(Scaling Law)

主要变体:编码器型(BERT,擅长理解)、解码器型(GPT、Claude、Llama,擅长生成)、编解码型(T5,擅长翻译、摘要)。今天的对话式大模型基本都是仅解码器(Decoder-only)结构。

与其他概念的关系:Transformer → 训练出 LLM;它的输入输出单位是 Token;注意力计算量随序列长度增长,这就是 Context 窗口有上限的根本原因。

2. LLM:用 Transformer 训练出的“大脑”

LLM(Large Language Model,大语言模型)是在海量文本上训练、参数规模达数十亿到万亿级的 Transformer 模型,如 Claude、GPT、Gemini、Llama、DeepSeek、Qwen。它的本质工作只有一件:根据已有的 Token,预测下一个最可能的 Token,然后不断重复。

典型训练流程

  1. 预训练(Pre-training):在互联网级文本上学习“预测下一个词”,获得语言和世界知识,得到“基座模型”。
  2. 指令微调(SFT):用“问题-优质回答”数据教它听懂指令、以对话形式回答。
  3. 对齐与强化学习(RLHF / RLAIF / RL):用偏好反馈和可验证任务(写代码、做数学)让它更有用、更安全、会推理、会调用工具。

能力与局限

擅长天生局限对应解决方案
理解、写作、翻译、编程、推理知识有截止日期,不知道最新或私有信息RAG、联网搜索 Tool
总结、归纳、生成结构化内容可能“幻觉”:自信地编造事实RAG 提供依据、引用来源
根据指令灵活切换角色只会输出文字,不能直接动手做事Tool、MCP、Agent
单次上下文内的深度分析本身无状态,每次调用都“失忆”Context 管理、记忆文件、Harness

关键认知:LLM 是一个无状态的函数——输入一串 Token,输出一串 Token。后面所有概念,都是围绕“如何组织输入、如何利用输出”展开的工程方法。

3. Token:模型读写的最小单位

Token 是 LLM 处理文本的基本单位,介于“字符”和“单词”之间。模型不直接看文字,而是先由分词器(Tokenizer)把文字切成 Token,再把每个 Token 映射成一个数字 ID 和一个向量(Embedding)。

分词示例(示意,不同模型切法不同)

  • unbelievable → un + believ + able(3 个 Token)
  • 人工智能 → 可能是 2–4 个 Token
  • 经验值(约数):英文 1 Token ≈ 0.75 个单词;中文 1 个汉字约 1–2 个 Token。

Token 为什么重要

维度影响
计费API 按输入 Token + 输出 Token 分别计价,输出通常更贵
容量Context 窗口以 Token 计量,如 200K、1M Token
速度模型逐 Token 生成,输出越长耗时越久
能力边界模型“看”的是 Token 而非字母,所以数字母、倒写单词这类任务反而容易出错

与其他概念的关系:Prompt、RAG 检索到的文档、Tool 的定义与返回结果、Skill 的说明——所有放进模型的东西最终都变成 Token,占用 Context、产生费用。Token 是整个体系的“货币”。

4. Context:模型的“工作记忆”

Context(上下文)是模型在一次推理中能看到的全部 Token,它的最大容量称为上下文窗口(Context Window)。模型没有真正的长期记忆,窗口外的信息对它而言等于不存在。

一次请求的 Context 通常包含

  1. System Prompt(系统提示:角色、规则、环境信息)
  2. Tool / MCP 工具的定义(名称、描述、参数格式)
  3. Skills 的简介列表(以及已加载的 Skill 正文)
  4. 记忆 / 项目说明(如 CLAUDE.md)
  5. 对话历史:用户消息、模型回复、工具调用与结果
  6. RAG 检索到的文档片段
  7. 当前这一轮的用户问题

上下文工程(Context Engineering)

随着应用变复杂,业界的关注点从“写好一句 Prompt”转向“管好整个 Context”:在有限的窗口里,在对的时机放入对的信息。常见手段:

  • 按需加载:RAG 只取相关片段;Skills 只在用到时才读全文。
  • 压缩摘要:对话过长时把旧内容总结成短摘要(Compaction)。
  • 外部记忆:把重要信息写入文件或数据库,需要时再读回。
  • 子智能体隔离:让子 Agent 在自己的 Context 里干重活,只把结论带回主线。
  • 缓存:不变的前缀(系统提示、工具定义)使用 Prompt Caching,降低成本和延迟。

为什么不能无限塞:窗口有硬上限;内容越多越贵、越慢;并且无关信息会稀释注意力,降低回答质量。可以说,RAG、MCP、Skills、Harness 的很多设计,都是为了解决 Context 有限这一核心矛盾。

5. Prompt:告诉模型“做什么、怎么做”

Prompt(提示词)是人或程序写给模型的输入文本,是 Context 中最可控、最直接的部分。对于一个无状态的 LLM 来说,Prompt 就是它完成任务的全部依据。

三种角色的消息

类型谁写作用
System Prompt(系统提示)开发者 / 产品设定身份、行为规则、输出格式、可用能力,全局生效
User Prompt(用户提示)最终用户具体的问题或任务
Assistant(模型回复)模型历史回复也会作为后续轮次的输入

提示工程(Prompt Engineering)常用技巧

  • 讲清背景与目的:说明为什么要做、给谁看,比堆砖规则更有效。
  • 给出示例(Few-shot):用 2–3 个输入输出例子展示期望。
  • 结构化:用 XML 标签或 Markdown 分隔指令、资料和问题。
  • 让模型先思考:思维链(Chain-of-Thought)或开启扩展思考,提高复杂问题准确率。
  • 指定格式:要求 JSON、表格等固定格式以便程序解析。

与其他概念的关系:Prompt 是“静态指令”;Skill 可以理解为“可按需加载的专业 Prompt 包”;Tool 和 MCP 的描述本质上也是写给模型看的 Prompt;Agent 的 System Prompt 定义了它的工作方式。

6. RAG:先查资料,再回答

RAG(Retrieval-Augmented Generation,检索增强生成)是在模型回答前,先从外部知识库检索相关资料,放进 Context,再让模型基于资料作答的技术。它相当于把“闭卷考试”变成“开卷考试”。

标准流程

  1. 索引(离线):把文档切成小块(Chunk),用 Embedding 模型转为向量,存入向量数据库。
  2. 检索(在线):把用户问题也转为向量,找出语义最接近的 Top-K 片段(常结合关键词检索、重排序 Rerank)。
  3. 增强:把片段拼进 Prompt:“请根据以下资料回答……”。
  4. 生成:LLM 基于资料作答,并可标注引用来源。

RAG 与微调(Fine-tuning)对比

对比项RAG微调
原理不改模型,改输入用数据继续训练,改模型参数
知识更新更新文档即可,实时需要重新训练
可追溯性可给出引用来源难以追溯
成本低,工程为主高,需算力和标注数据
适合企业知识库问答、客服、文档助手固定风格、特定格式、领域术语

演进趋势:传统 RAG 是“固定流程先检索再回答”;在 Agent 时代,检索变成了一个 Tool(如搜索、grep、读文件),由模型自己决定何时查、查什么、查几次,称为 Agentic RAG / Agentic Search。

7. Tool:让模型“动手”

Tool(工具,也叫 Function Calling / Tool Use)是开发者提供给模型、由外部程序执行的函数,例如搜索网页、查天气、读写文件、执行代码、查数据库。关键点:模型自己不执行工具,它只输出“我要调用哪个工具、参数是什么”,由外部程序真正执行。

一个工具的定义包含:名称(get_weather)、自然语言描述(告诉模型何时该用)、参数的 JSON Schema(如 city: string)。

调用流程

  1. 开发者把工具定义随请求一起发给模型(占用 Context)。
  2. 用户问:“上海明天要带伞吗?”
  3. 模型输出结构化请求:get_weather({"city": "上海", "date": "明天"})。
  4. 应用程序执行该函数,把结果(“小雨,降水概率 80%”)作为工具结果返回给模型。
  5. 模型基于结果回答:“建议带伞。”

Tool 的价值:它让 LLM 从“只会说”变成“能做”——获取实时信息、精确计算、修改外部世界。

留下的问题:每个 AI 应用都要为每个外部系统(GitHub、Slack、数据库……)单独写一套工具对接代码,M 个应用 × N 个系统 = M×N 种集成。这正是 MCP 要解决的问题。

8. MCP:AI 世界的“USB-C 接口”

MCP(Model Context Protocol,模型上下文协议)是 Anthropic 于 2024 年 11 月开源的开放标准,规定了 AI 应用与外部工具、数据源之间的统一通信方式,现已被 OpenAI、Google、Microsoft 等主流厂商支持。它把 Tool 的对接从 M×N 变成 M+N:系统方写一次 MCP Server,所有支持 MCP 的 AI 应用都能直接使用。

三个角色

角色是什么例子
Host(宿主)用户使用的 AI 应用Claude Desktop、Claude Code、Cursor
Client(客户端)Host 内部与某个 Server 保持 1:1 连接的模块由 Host 自动创建
Server(服务端)封装某个系统能力的程序GitHub、Slack、Postgres、浏览器 MCP Server

Server 能提供的三类能力

  • Tools(工具):模型可调用的函数,如“创建 Issue”。
  • Resources(资源):可读取的数据,如文件、数据库记录。
  • Prompts(提示模板):预置的工作流模板。

传输方式有本地的 stdio 和远程的 HTTP(Streamable HTTP),消息格式基于 JSON-RPC 2.0。

要点辨析

  • MCP 不是新的模型能力,而是 Tool 的标准化分发和连接方式。模型看到的仍然是普通的工具定义。
  • 代价:每连接一个 Server,它的工具定义就占用一部分 Context。连太多会挤占空间,所以现代 Harness 会“延迟加载”工具定义。
  • 安全:第三方 Server 返回的内容可能包含“提示注入”,应只接入可信的 Server。

9. Agent:会自己循环干活的 LLM

Agent(智能体)是让 LLM 在一个循环中自主决定下一步、调用工具、观察结果,直到完成目标的系统。一个常见的简洁定义是:Agent = LLM + 工具 + 循环。

Agent 循环(Agentic Loop)

  1. 感知:读取当前 Context(目标、历史、上一步工具结果)。
  2. 思考:规划接下来做什么。
  3. 行动:调用一个或多个 Tool。
  4. 观察:工具结果写回 Context。
  5. 重复 1–4,直到模型判断任务完成并给出最终回复(这也是经典的 ReAct 模式:Reason + Act)。

Agent 与普通聊天机器人、工作流的区别

形态谁决定步骤例子
聊天机器人一问一答,没有步骤早期 ChatGPT 网页版
工作流(Workflow)开发者写死的代码路径固定的 RAG 问答管道
Agent模型在运行中动态决定Claude Code 修 Bug、Deep Research 写报告

多智能体(Multi-Agent):主 Agent 把大任务拆分给多个子 Agent(Subagent),每个子 Agent 有独立的 Context 和专门的工具,并行工作后汇报结论。优势是并行和上下文隔离,代价是 Token 消耗成倍增长。

关键认知:Agent 的“智能”来自 LLM,“手脚”来自 Tool / MCP,“专业知识”来自 Skills 和 RAG,而“身体”——让循环真正跑起来的那个程序——就是 Harness。

10. Harness:驱动 Agent 运行的“外壳”

Harness(直译“马具/线束”,可译作“智能体运行框架”)是包裹在 LLM 外面、让它能作为 Agent 工作的那层程序。LLM 只是一个“输入 Token、输出 Token”的函数,Harness 负责其余的一切。同一个模型,换一个 Harness,表现可能天差地别。

Harness 的核心职责

职责具体内容
驱动循环调用模型 → 解析工具请求 → 执行 → 把结果送回,直到任务结束
组装 Context拼接 System Prompt、工具定义、Skills 列表、记忆、对话历史
管理 Context上下文快满时自动压缩、延迟加载工具、开启 Prompt 缓存
提供内置工具读写文件、执行命令、搜索、浏览器、启动子 Agent
接入扩展连接 MCP Server、加载 Skills、插件
安全与权限沙箱、权限审批(危险操作前询问用户)、Hooks
交互界面终端、桌面应用、IDE 插件、网页

典型例子:Claude Code(以及其底层的 Claude Agent SDK)、Cursor、OpenAI Codex CLI、Gemini CLI。你现在正在使用的 Claude Code 桌面端,就是一个 Harness:它把 Claude 模型与文件系统、终端、浏览器、MCP 连接器、Skills 组装在一起。

一个形象的比喻:LLM 是发动机,Harness 是整辆车的底盘、方向盘和刹车系统。发动机决定动力上限,底盘决定这份动力能否安全、高效地转化为前进。

11. Skills:按需加载的“专业技能包”

Skills(Agent Skills)是 Anthropic 于 2025 年 10 月推出、后成为开放标准的机制:把某类任务的专业知识、操作步骤、脚本和模板打包成一个文件夹,Agent 在需要时自动加载。如果说 Tool 给了 Agent “手”,Skill 就是给了它一本“操作手册”。

结构:每个 Skill 是一个文件夹,核心是 SKILL.md(开头是名称 + 一句话描述,正文是详细指南),还可附带参考文档、Python 脚本、模板文件。例如处理 PDF、生成 Excel/PPT、按公司规范写周报。

核心设计:渐进式披露(Progressive Disclosure)

  1. 第一层:平时 Context 里只放每个 Skill 的名称和一句话描述(每个约几十 Token)。
  2. 第二层:模型判断任务相关时,才读入 SKILL.md 全文。
  3. 第三层:正文中引用的脚本和参考文档,用到时再读或直接执行。

这样可以安装几十上百个 Skill,却几乎不占用 Context——正是上下文工程的典型实践。

Skills / Tool / MCP / Prompt 辨析

概念提供什么以什么形式何时进入 Context
Prompt一次性指令文字始终在
Tool一个可执行的动作函数 + Schema定义通常始终在
MCP一组标准化接入的外部工具和数据独立运行的 Server连接后,工具定义进入
Skill“怎么做好某类事”的方法论文件夹(说明 + 脚本 + 资料)按需加载

一句话区分:MCP 解决“能连上什么”,Skill 解决“知道怎么做”,二者互补。例如 MCP 让 Agent 能读写你的 Notion,Skill 告诉它你们公司的需求文档应该怎么写。

12. 长程记忆:让“失忆”的 LLM 跨会话记住事情

位置:长程记忆位于扩展层,是一个由 Harness 管理的外部存储;它在会话结束时把重要信息写出 Context,在新会话开始时再把相关部分读回 Context。 LLM 本身是无状态的,Context 只是“工作记忆”;长程记忆弥补的是“关掉窗口就忘光”这个缺口。

记忆的三种形态

形态存在哪里持续多久怎么更新例子
参数记忆模型权重直到模型更新预训练 / 微调“巴黎是法国首都”
工作记忆(短期)Context 窗口本次会话对话自动累积,满了就压缩刚才读过的文件
外部记忆(长程)文件、数据库、向量库跨会话、可永久Agent 主动写入 / 整理用户偏好、项目规范、上次进度

长程记忆的存取流程

  1. 写入:Agent 在对话中发现值得记住的事(用户纠正、偏好、项目决策),调用“记忆工具”写入外部存储。
  2. 整理:定期合并重复、删掉过时信息,防止记忆膨胀或自相矛盾。
  3. 召回:新会话开始时,Harness 把记忆索引放入 Context;细节按需读取(与 RAG 和 Skills 的渐进式加载同理)。

常见实现

  • 文件式记忆:Claude Code 的 CLAUDE.md 与记忆目录、ChatGPT 和 Claude 的“记忆”功能。简单、可读、用户可直接编辑。
  • 向量 / 知识图谱记忆:如 Mem0、Letta(原 MemGPT)等框架,适合海量、非结构化的历史。
  • 通过 MCP 接入:记忆库可以做成一个 MCP Server,让多个 Agent 共享。

与 RAG 的区别:两者技术很像(都是“存起来、用时取”),但 RAG 的资料来自外部、通常只读;长程记忆的内容来自 Agent 自己的经历,由 Agent 读写。一句话:RAG 是查公司档案,记忆是写自己的工作笔记。

13. RSI:递归自我改进

位置:RSI 不属于四层中的任何一层,而是套在整个架构外面的一个“外循环”:系统层的 Agent 反过来去改进模型层(训练更强的 LLM)和扩展层(写更好的 Skill、工具和 Harness),更强的系统再去做下一轮改进。

RSI(Recursive Self-Improvement,递归自我改进)指 AI 系统能提升自身能力,而提升后的系统又更擅长继续提升自己,形成正反馈。Agent 循环解决的是“完成一个任务”,RSI 循环解决的是“让自己变得更强”。

从弱到强的三个层次

层次改进的对象是否改权重今天的状态
上下文级Prompt、记忆、Skills、工具否已普遍可用:Agent 自己写 Skill、整理记忆、优化 Prompt
训练级训练数据、奖励信号、训练代码是,由人把关正在发生:模型生成合成数据、当评审、写训练代码和实验
全自动模型自主设计并训练下一代自己是,无人工介入尚未实现,是前沿实验室重点监测的风险点

今天已经能看到的雏形

  • 自我对弈与强化学习:AlphaGo Zero 通过和自己下棋变强;推理模型在可验证任务(数学、代码)上用自己生成的解答训练。
  • AI 评审 AI:RLAIF、Constitutional AI 等方法让模型代替部分人工标注。
  • AI 写 AI 的代码:编程 Agent 已大量参与大模型公司自己的研发代码。
  • Agent 自我完善:Agent 用 skill-creator 一类工具编写和评测自己的 Skill,并把经验写入长程记忆。

为什么重要:如果 RSI 闭环跑通,能力增长可能远快于人类研发的节奏。因此各大实验室的安全框架(如 Anthropic 的 Responsible Scaling Policy)都把“自主 AI 研发能力”列为需要特别评估和防护的能力阈值。对普通开发者来说,可落地的是第一层:让 Agent 从每次任务中沉淀记忆和 Skill,越用越顺手。

14. 其他值得加入的新技术

这些技术大多不是新的一层,而是在原有四层里继续加深:模型层变得更会思考、更高效,扩展层从“调 API”扩展到“操作电脑”,系统层从单个 Agent 走向 Agent 网络。

技术一句话解释所在层与已有概念的关系
推理模型 / 扩展思考回答前先生成一段长思考,用推理时的算力换准确率(Test-time Compute)模型层思考过程也是 Token,占用 Context 和费用
MoE 混合专家模型内部有很多“专家”子网络,每个 Token 只激活少数几个模型层Transformer 的一种变体,让大模型更便宜、更快
多模态同一个模型能看图、听音频、读 PDF、生成图像和语音模型层图片和音频也被切成 Token 放进 Context
蒸馏与小模型用大模型教小模型,小模型可在手机或本地运行模型层常作为子 Agent 或路由模型,降低成本
上下文压缩与 Prompt 缓存自动总结旧对话、复用不变的前缀交互层上下文工程的核心手段,由 Harness 实现
Computer Use / Browser Use模型看屏幕截图、点击鼠标、敲键盘,像人一样操作软件扩展层一类特殊的 Tool,用于没有 API 的场景
代码执行沙箱给 Agent 一个隔离的虚拟机去运行代码、处理文件扩展层Skills 里的脚本在这里执行;也是安全边界
A2A 等 Agent 间协议不同厂商的 Agent 之间互相发现、委托任务系统层MCP 连接“Agent 与工具”,A2A 连接“Agent 与 Agent”
多智能体编排主 Agent 拆任务、派子 Agent 并行干活系统层Harness 的能力;用上下文隔离换并行度
Hooks 与护栏在工具调用前后自动运行检查脚本、拦截危险操作系统层Harness 的安全与权限机制
评测(Evals)与可观测性用测试集和调用日志衡量 Agent 做得对不对、花了多少 Token跨层RSI 的前提:没有可靠的评测就无法判断“改进”
Agentic RL 与训练环境在模拟环境里让模型反复完成多步任务并按结果奖励模型层 ↔ 系统层把 Agent 循环反哺给训练,是训练级 RSI 的主要路径

14.1 模型层:更会思考、更高效、能看能听

推理模型 / 扩展思考(Reasoning Models / Extended Thinking)

  • 是什么:模型在给出答案前,先生成一段较长的内部思考:拆解问题、尝试思路、自我检查、发现错误后回退。代表有 OpenAI o 系列、DeepSeek-R1、Claude 的扩展思考。
  • 原理:通过强化学习在数学、编程等可验证的任务上训练,答对了就奖励,模型自己学会“多想一会儿”。这开启了新的扩展方向:除了加大训练规模,还可以增加推理时的算力(Test-time Compute)。
  • 代价:思考过程也是 Token,会占用 Context、增加费用和延迟。简单问题应低思考量,复杂问题才开高思考量。
  • 对 Agent 的意义:更强的规划和纠错能力,是长任务 Agent 能工作数小时而不跑偏的基础。

MoE 混合专家(Mixture of Experts)

  • 是什么:把 Transformer 中的前馈层拆成许多个“专家”子网络,由一个“路由器”为每个 Token 挑选少数几个专家参与计算。
  • 好处:总参数量很大(知识容量大),但每个 Token 只激活小部分参数(计算量小),用更低成本获得大模型的效果。DeepSeek-V3、Mixtral、Qwen 的 MoE 版本都采用这种结构。
  • 理解要点:MoE 中的“专家”是内部的数学结构,并不对应“数学专家”“代码专家”这样的人类分工;与多智能体是完全不同的概念。

多模态(Multimodal)

  • 是什么:同一个模型能处理文字以外的输入和输出:看图片和截图、读 PDF 和图表、听和说语音、生成图像或视频。
  • 原理:图片、音频被切成小块,转换成与文字 Token 同一空间的向量,一起放进 Context。所以一张图也会消耗数百到上千个 Token。
  • 对 Agent 的意义:多模态是 Computer Use 的前提——模型必须“看得懂”屏幕截图才能操作电脑。

蒸馏与小模型(Distillation / SLM)

  • 是什么:用大模型(教师)的输出去训练小模型(学生),让小模型在特定任务上接近大模型的水平。
  • 好处:更快、更便宜,可以在手机、笔记本电脑上本地运行,数据不出设备。
  • 在架构中的用法:常见的做法是“大小模型搭配”——大模型做主 Agent 负责规划,小模型做子 Agent 或路由器,处理大量简单任务,降低整体成本。

14.2 交互层:把有限的 Context 用得更久、更便宜

上下文压缩(Compaction)

  • 是什么:当对话接近 Context 上限时,Harness 让模型把前面的内容总结成一份精简摘要,用摘要替换原始历史,对话就能继续下去。
  • 类似手段:清除旧的工具返回结果(保留“调用了什么”,丢掉大段输出)、把长内容写进文件只在 Context 里留路径。
  • 意义:让 Agent 能连续工作数小时,超过单个窗口的容量。与长程记忆配合使用:压缩会丢失细节,重要信息应先写入记忆。

Prompt 缓存(Prompt Caching)

  • 是什么:每次请求都会重发 System Prompt、工具定义和对话历史。如果这些前缀没变,服务端可以复用上次的计算结果,不必重算。
  • 好处:命中缓存的部分费用大幅降低、响应更快;对工具调用频繁的 Agent 尤其关键——一个任务可能要请求模型几十上百次。
  • 设计启示:把不变的内容放在前面、变化的内容放在后面,并尽量避免中途修改工具列表。这也是为什么很多 Harness 采用“延迟加载工具”而不是动态修改工具定义。

14.3 扩展层:从“调 API”到“操作电脑”

Computer Use / Browser Use(电脑与浏览器操作)

  • 是什么:模型通过截图“看”屏幕,再输出鼠标点击、键盘输入、滚动等动作,由 Harness 在真实的桌面或浏览器中执行。代表有 Claude Computer Use、OpenAI 的 Operator / ChatGPT Agent,以及各类浏览器 Agent。
  • 和普通 Tool 的区别:普通 Tool 要求对方系统提供 API;Computer Use 把“整台电脑”当作一个工具,可以操作没有 API 的老系统、网页表单和桌面软件。
  • 局限:比调 API 慢、更耗 Token(每步都要截图)、更容易出错。经验法则:有 API 就用 Tool / MCP,没有 API 才用 Computer Use。
  • 安全:网页内容可能包含针对 AI 的“提示注入”,涉及登录、支付、发送消息的操作应由人确认。

代码执行沙箱(Code Execution Sandbox)

  • 是什么:给 Agent 一个隔离的虚拟机或容器,可以自由运行 Python / Shell、安装依赖、读写文件、生成图表和文档,不会影响主机。
  • 为什么重要:“写代码并运行”是最通用的工具——一个沙箱可以替代成百个专用工具。精确计算、数据分析、文件格式转换都靠它。
  • 与 Skills 的关系:Skill 中附带的脚本就是在沙箱里执行的。Skill 提供“方法”,沙箱提供“运行场所”。
  • 与安全的关系:沙箱是 Agent 的主要安全边界,限制它能访问的文件、网络和凭证。

14.4 系统层:从单个 Agent 到 Agent 团队

A2A 等 Agent 间协议(Agent-to-Agent)

  • 是什么:Google 于 2025 年发起、后捐给 Linux 基金会的开放协议,让不同厂商、不同框架构建的 Agent 能互相发现对方的能力(通过“Agent Card”)、委托任务、同步进度。
  • 和 MCP 的分工:MCP 连接的是 Agent 与工具(工具是被动的,调用即返回);A2A 连接的是 Agent 与 Agent(对方是主动的,可能要工作很久、中途提问)。两者互补。
  • 场景:企业的招聘 Agent 把“安排面试”委托给另一家供应商的日程 Agent。

多智能体编排(Multi-Agent Orchestration)

  • 是什么:主 Agent(Orchestrator)把大任务拆成子任务,分派给多个子 Agent 并行执行,再汇总结果。常见模式:主从模式、流水线、“做事 + 审查”互相检查。
  • 好处:并行提速;每个子 Agent 有独立 Context,主线不会被大量中间结果撑爆;不同子 Agent 可配置不同工具和模型。
  • 代价:Token 消耗成倍增长,协调不好会重复劳动或结论冲突。适合可以拆开并行的宽广任务(如大规模调研),不适合步步依赖的任务。

Hooks 与护栏(Guardrails)

  • 是什么:Hooks 是 Harness 在特定事件(工具调用前后、任务结束时)自动运行的脚本;护栏是对输入输出的规则检查。
  • 典型用法:禁止删除关键目录、改代码后自动格式化和跑测试、输出前过滤敏感信息、记录审计日志。
  • 关键区别:写在 Prompt 里的规则模型“可能”会遵守;Hooks 是确定性的代码,“一定”会执行。必须保证的事情用 Hooks,建议性的事情用 Prompt。

14.5 跨层:衡量好坏,并把经验反哺给模型

评测(Evals)与可观测性(Observability)

  • Evals 是什么:一组有标准答案或评分规则的测试任务,用来衡量模型或 Agent 做得对不对。评分方式可以是代码自动判定、另一个模型打分(LLM-as-Judge),或人工评审。公开基准如 SWE-bench(修真实代码 Bug)、τ-bench(客服工具使用)、OSWorld(操作电脑)。
  • 可观测性是什么:记录 Agent 每一步的输入、工具调用、耗时和 Token 消耗(Tracing),出问题时能回放整个过程。
  • 为什么重要:Agent 的行为每次都可能不同,没有 Evals 就无法知道改了 Prompt、换了模型、加了 Skill 之后是变好还是变差。Evals 是所有“改进”的前提,包括 RSI。

Agentic RL 与训练环境(RL Environments)

  • 是什么:为模型搭建模拟的工作环境(代码仓库、网站、办公软件、客服系统),让它在里面以 Agent 的方式反复完成多步任务,按最终结果给奖励,用强化学习更新权重。
  • 和传统训练的区别:预训练教模型“说得像人”,Agentic RL 教模型“把事情做成”——会规划、会用工具、会从失败中恢复。今天编程 Agent 能力的快速提升,很大程度上来自这种训练。
  • 在架构中的位置:它把系统层的 Agent 循环“反哺”给模型层,正是 RSI 训练级外循环的具体实现。它与 Evals 密不可分:奖励信号本质上就是一套自动化的评测。

如果只挑三个先学:推理模型(决定今天模型能力的上限)、Computer Use(决定 Agent 能触及的范围)、Evals(决定你能否判断系统是否变好)。

关系总结

这些概念可以用“一家公司里的一位新员工”来类比:模型是员工的大脑,其余概念分别是它的工作台、资料、工具、手册和办公环境。

概念一句话定义所在层公司类比
Transformer基于自注意力的神经网络架构模型层大脑的生理结构
LLM用 Transformer 在海量文本上训练的模型模型层一位博学但失忆的新员工
Token模型读写和计费的最小单位模型层员工读写的字词
Context模型一次能看到的全部 Token交互层员工的办公桌面,大小有限
Prompt写给模型的指令交互层领导交代的任务说明
RAG先检索资料再作答扩展层先去资料室查档案
Tool模型可请求执行的外部函数扩展层电脑、电话等办公工具
MCP连接外部工具的统一协议扩展层统一插座标准,任何设备即插即用
Skills按需加载的专业方法包扩展层岗位操作手册,用时才翻
长程记忆跨会话保存、由 Agent 读写的外部存储扩展层员工自己的工作笔记本
AgentLLM + 工具 + 循环,自主完成任务系统层能独立负责项目的员工
Harness驱动 Agent 运行的外壳程序系统层公司的办公环境与管理制度
RSI系统改进自身、越改越会改的正反馈外循环员工总结经验、改进流程,甚至参与培训下一代员工

一次完整请求的端到端流程

以“帮我汇总本周 GitHub 上的 Issue,按团队规范写周报”为例:

  1. 用户提问:这句话就是 User Prompt。
  2. Harness 组装 Context:System Prompt + GitHub MCP 的工具定义 + “周报”Skill 的简介 + 历史对话 + 用户问题,全部切成 Token 送入 LLM。
  3. LLM 推理:基于 Transformer 的模型判断“我需要先拿到 Issue 数据,并看看周报规范”。
  4. Harness 执行:调用 GitHub MCP Server 的工具取回 Issue 列表,并加载周报 Skill 全文;结果写回 Context,再让 LLM 推理一轮——这就是 Agent 循环,可能重复多次。如果需要查公司内部文档,还可能触发 RAG 检索。
  5. 最终回答:信息足够后,LLM 按 Skill 规定的格式生成周报,循环结束。

三条关系主线

  • 从下到上的依赖:Transformer → LLM → 处理 Token → 受限于 Context。
  • 往 Context 里放什么:Prompt(指令)、RAG(知识)、Tool / MCP(能力与结果)、Skills(方法)。
  • 谁来驱动:Agent 是行为模式(循环决策),Harness 是实现这种模式的具体程序。

结论与学习路径

核心结论:这 11 个概念围绕一条主线展开——LLM 很聪明,但只能看到 Context 里的 Token;其余所有技术都在解决“往有限的 Context 里放什么、放进去后如何行动”。

  • 模型层(Transformer、LLM、Token)决定能力上限,普通开发者一般直接选用,不自己训练。
  • 交互层(Context、Prompt)决定这份能力能发挥出多少,是投入产出比最高的环节。
  • 扩展层(RAG、Tool、MCP、Skills、长程记忆)分别补知识、补行动、补连接、补方法论、补经验。
  • 系统层(Agent、Harness)把一切串成能自主完成任务的产品。
  • 外循环(RSI)让系统反过来改进各层:今天主要发生在记忆和 Skills 层面,训练层面仍由人把关。
  • 新技术在每层继续加深:模型层更会思考(推理模型、MoE、多模态),交互层更省(压缩、缓存),扩展层能操作电脑(Computer Use、沙箱),系统层走向 Agent 协作(A2A、多智能体、Hooks);Evals 和 Agentic RL 把各层串成 RSI 外循环。

建议学习路径

  1. 用好现有产品:在 Claude / ChatGPT 中练习写清晰的 Prompt,体会 Context 的作用。
  2. 调用 API:写一个最小程序调用模型,观察 Token 计费和 System Prompt 的效果。
  3. 加上 Tool:实现一个天气或计算器工具,理解“模型提议、程序执行”的分工。
  4. 做一个 RAG:用自己的文档搭一个问答助手。
  5. 使用 Harness:在 Claude Code 中接入一个 MCP Server,并编写一个自己的 Skill。
  6. 构建 Agent:用 Claude Agent SDK 等框架做一个能多步完成任务的小 Agent。
  7. 有余力再深入 Transformer 原理(推荐先读《Attention Is All You Need》的图解类文章)。