Skip to main content

个人 Agent 运行框架

可以由你自己运行、自己拥有的开源 AI 员工

上一节把通用 agent(Claude Code、OpenCode、Cowork 和 OpenWork)交到了你手上,并教你如何驾驭、指挥它们,以及让它们循环运行。它们很强大,但有边界。通用 agent 运行在你打开的一次会话里。它在你盯着的时候干活,会话一结束,它的大部分工作上下文也随之结束。运行时就是你。合上笔记本电脑,这个工人就不复存在了。

这一节要打破的就是这个上限。

agent 运行框架是一种软件,它能把模型变成一个不需要你在场也能运行的工人。今年的运行框架工程文献把这一点说得很直白:agent 就是模型加运行框架。模型负责回答问题。运行框架则让它能持续运行、跨会话记住学到的东西,并调用工具去行动。这一层会比你接入其中的任何单个模型活得更久,而这正是各大平台厂商如今争抢它的原因。

这就是这一节要带你跨过的那条线:从一个你驾驭的 agent,到一个你拥有的 agent。

每个运行框架由什么构成

OpenClaw 和 Hermes 几乎在所有事情上都不一致,唯独在这一点上例外。把任意一个拆开,你都会发现同样的构造:

  • 运行时:在任务之间让 agent 保持存活,而不只是在聊天期间。
  • 网关:把消息传进传出,让 agent 在你已经在用的地方就能找到你。
  • 记忆:跨会话持久保留,让 agent 每天开始时都比昨天知道得更多。
  • 工具:agent 调用来真正把事情做成的外部能力(MCP 服务器、API)。
  • 技能:agent 习得并复用的可移植专长(开放的 agentskills.io 格式,跨运行时通用)。
  • 身份:agent 以谁的身份运行,以及这个身份被允许接触什么。
  • 策略与可观测性:它可以做什么,以及它做过什么的记录。

把这个形状学一次,两门速成课都挂在同一个框架上。你之后添加的一切(一个新渠道、一项新技能、一个定时任务)都不过是这七者之一的延伸。其中两者——技能和连接器(上面提到的工具)——是可移植的部分:它们建立在开放格式之上,可以跨越 claude.ai、你驾驭过的通用 agent 以及你在这里构建的运行框架,所以你教给工人的东西不会被锁定在任何单一平台上。

在同一层上的两种押注

OpenClaw 和 Hermes 不是两个做同一件事的工具。它们是对「运行框架的哪一部分才是控制点」这个问题下的两种赌注。区别在于侧重点,而非互斥。OpenClaw 也有记忆和技能;Hermes 也能在二十多个渠道上对话。但真正定义各自的,是它们的重心所在。

一张分叉图。顶部有一个方框「同一个运行框架」,列出了七个共享部分:运行时、网关、记忆、工具、技能、身份、策略。它分裂成两个方框。左边「OpenClaw——押注在网关上」是广度优先:一个 agent 跨越 WhatsApp、Telegram、Discord、Slack 等众多渠道。右边「Hermes——押注在记忆上」是深度优先:它用数周时间学会你,并运行在你自己拥有的基础设施上。图注写道:在同一个七部分的层上选择不同的控制点,而且没有什么能阻止你两个都运行。

OpenClaw 押注在网关上。 广度优先。一个 agent 从同一个地方在 WhatsApp、Telegram、Discord、Slack 等渠道上作答,背后是一个庞大的社区技能市场。正是这个项目证明了个人 AI 员工是真实存在的,也证明了人们想要它们。它的强项是触达范围。

Hermes 押注在记忆上。 深度优先。一个 agent 跨越数周记住你的代码库、你的约定和你过去的决定,在攻克一个难题后发展出新技能,并在工作中不断打磨它们。它被设计为在你自己拥有的基础设施上持久运行。它的强项是它学的是

这正是你已经从云端熟悉的那种取舍:一个宽广、便利的网关,对上一个深入、自管、会不断积累的工人。读完这一节,你将能够刻意地做出选择,而不是听任默认,并且能两个都运行起来,因为这里没有任何东西强迫你二选一。

为什么所有权才是关键所在

在两门课底下都有一个更安静的论点,它正是这一节作为「通用 Agent」的对等篇章而存在、而非作为它脚注的原因。

当一个运行框架让你 agent 的记忆、身份和运行时保持存活时,问题就不再是「这个月哪个模型最聪明」,而变成了「我一直在训练的这个工人归谁所有」。各大平台厂商心知肚明。微软的 Scout 和英伟达的 NemoClaw 把这些同样的运行框架裹上治理和身份的外壳:便利、可直接投入生产,而且归厂商所有。一个已经学了你一整年习惯的 agent,是最高的切换成本。比起渠道触达,记忆才是各大平台厂商押注的那种持久形态的锁定。

这一节教的是另一条路:你自己运行的开源运行框架,其中的运行时、记忆和身份都属于你。这里的所有权是字面意义上的,连成本也包括在内:你自己运行的运行框架是通过你自己的 API 访问来调用模型的——按用量计费、每次调用付费——而不是搭着一份打包的 claude.ai 订阅,所以运行时、记忆、身份,还有账单全都是你的。这就是这笔交易——完全的控制,完全的责任。这并不是因为厂商的封装是错的(对一家受监管的企业来说,它们往往是对的),而是因为在你亲手构建并掌握过自管版本之前,你无法判断这个取舍。

这一节是共享路径上的一步,不是支线。它位于使用 agent(General Agents 一节)和投入你的 mode(Mode 1 或 Mode 2)之间的主干上:每个人都先在这里给自己一个持久 agent,然后再专门化。你通过 coding agent(Claude Code 或 OpenCode)来驱动安装,它会替你完成设置,所以无论你自己是否写代码,这一步都向你开放。你在这里构建的运行框架,正是之后 Mode 1 → Mode 2 交接所称的两条路之一,所以当那个分叉出现时,你已经拥有它指向的东西。

从这里开始

两门速成课共享一个前提:你通过一个通用 agent 来驾驭运行框架。你在 Agentic 编程 里学到的 Claude Code 或 OpenCode,就是那个为你安装、配置并操作运行框架的东西。上一节里的通用 agent,在这一节里成了那个工人的安装器。如果还没学,请先完成通用 Agent 那一节。

  • 搭配通用 Agent 的 OpenClaw:90 分钟、六个场景,从零开始把一位个人 AI 员工装到你的手机上。网关优先的运行框架,亲手实践。
  • 搭配通用 Agent 的 Hermes:记忆优先的运行框架。持久的上下文、自我改进的技能,一个学会你工作方式并在不同模型间保持可移植的 agent。

读完这一节,你将拥有一个工人:它在你睡觉时也会作答,记得你上周教它的东西,并运行在属于你的基础设施上。这就是使用 AI 和雇用 AI 之间的区别。