关于人工智能持续学习的大多数讨论都聚焦于一件事:更新模型权重。但对于 AI 智能体而言,学习可以发生在三个不同的层面:模型层、控制层和上下文层。理解这些差异将彻底改变你构建持续进化系统的思维方式。

智能体系统的三个主要层面包括:

  • 模型层:即模型权重本身。
  • 控制层:指驱动所有智能体实例的模型外围框架。这包括驱动智能体的核心代码,以及始终作为框架组成部分的指令或工具集。
  • 上下文:存在于框架之外、可用于配置框架的额外上下文(指令、技能)。

img

示例 #1:将其映射到像 Claude Code 这样的编码代理:

  • 模型:claude-sonnet 等
  • Harness: Claude Code
  • 上下文:CLAUDE.md、/skills、mcp.json

示例 #2:将其映射到 OpenClaw:

  • 模型:多种
  • Harness:Pi + 其他辅助工具
  • 上下文:SOUL.md,来自 clawhub 的技能

当我们谈论持续学习时,大多数人会立刻想到模型。但实际上,一个 AI 系统可以在以下三个层面进行学习。

模型层的持续学习

当大多数人谈论持续学习时,他们最常指的就是这个:更新模型权重。

更新技术包括监督微调(SFT)、强化学习(例如 GRPO)等。

这里的核心挑战是灾难性遗忘——当模型基于新数据或任务进行更新时,它往往会在之前掌握的内容上表现下降。这是一个开放的研究问题。

当人们为特定的智能体系统训练模型时(例如,你可以将 OpenAI 的 Codex 模型视为为其 Codex 智能体而训练),他们大多是为整个智能体系统进行训练。理论上,你可以在更细粒度的层面上进行(例如,为每个用户使用一个 LoRA),但在实践中,这主要在智能体层面进行。

在控制层进行持续学习

如前所述,harness 指的是驱动智能体的代码,以及始终作为 harness 组成部分的任何指令或工具。

随着harness这个概念日益普及,多篇论文开始探讨如何优化harness设计。

最近的一个是Meta-Harness:模型harness的端到端优化。

核心思想是让智能体在循环中运行。首先让它执行一系列任务,然后进行评估。接着将所有日志存储到文件系统中。最后运行一个编码智能体来查看这些执行轨迹,并提出对框架代码的修改建议。

img

与模型的持续学习类似,这通常在智能体层面进行。理论上,你可以在更细粒度的层面实现这一点(例如,为每个用户学习不同的代码框架)。

上下文层的持续学习

“上下文”位于系统框架之外,可用于配置框架。上下文包含指令、技能甚至工具等元素。这通常也被称为记忆。

这种上下文类型同样存在于框架内部(例如,框架可能包含基础系统提示、技能等)。区别在于它是框架的一部分还是配置的一部分。

学习上下文可以在多个不同层面进行。

学习上下文可以在智能体层面进行——智能体拥有持久的“记忆”,并随时间更新自身配置。一个很好的例子是 OpenClaw,它拥有随时间更新的 SOUL.md 文件。

学习上下文通常在租户层面(用户、组织、团队等)进行。在这种情况下,每个租户都有自己随时间更新的上下文。例如,Hex 的 Context Studio、Decagon 的 Duet、Sierra 的 Explorer。

你也可以混合搭配!因此,你可以拥有一个具备代理级别上下文更新、用户级别上下文更新以及组织级别上下文更新的智能体。这些更新可以通过两种方式实现:

  • 事后通过离线任务进行。类似于系统更新——处理大量近期追踪记录以提取见解并更新上下文。这就是 OpenClaw 所称的“梦境学习”。
  • 在智能体运行的热路径中。智能体可以决定(或用户可提示其)在执行核心任务时更新其记忆。

img

这里需要考虑的另一个维度是记忆更新的明确程度。是用户提示智能体记住,还是智能体基于其核心指令自行记忆?

对比

img

Trace是核心

所有这些流程都由追踪记录驱动——追踪记录是智能体执行路径的完整记录。LangSmith 是我们的平台,其功能之一便是协助收集这些追踪记录。

然后,你可以通过多种不同的方式利用这些轨迹。

如果你想更新模型,可以收集轨迹,然后与像 Prime Intellect 这样的合作伙伴合作,训练你自己的模型。

若想改进框架,可使用 LangSmith CLI 和 LangSmith Skills 为编码智能体提供追踪数据访问权限。我们正是通过这种方式在终端基准测试中优化了 Deep Agents(我们开源的、模型无关的通用基础工具链)。

若希望实现随时间推移学习上下文(无论是在智能体、用户还是组织层面),您的智能体框架必须支持此功能。Deep Agents——我们选择的框架——以生产就绪的方式提供了这一支持。请参阅相关文档,了解如何实现用户级记忆、背景学习等功能的示例。