Skip to main content

General Agents

这些工具不只是会说话:它们会做事。学会驾驭其中一个;本书后面的所有内容都建立在这项能力之上。

Foundations 教会了你 AI 是什么,以及在使用 AI 时如何保住自己的判断力。本节就是你拿起本书其余部分会一直使用的工具的地方:一个 general agent,也就是不只会回答、还会行动的 AI。它会打开你的文件、阅读它们、编写并运行代码,还会使用其他应用把任务完成。

开始时不用安装任何东西。本节的第一步,就在你学习 Foundations 时使用的同一个浏览器标签页里完成:

  • 网页上的 General Agents:这是整个章节的正门。无需安装,直接在浏览器标签页里指挥第一个真正的 agent:了解什么是远程会话、文件实际存在哪里、审批如何发送到手机,以及如何用同一套结构理解任何新的 agent 产品。无论会不会编程,每个人都在第 1 天从这里开始。

准备好把 agent 带到自己的设备上时,进入本节其余内容有两扇门,走哪一扇只取决于你是谁:

同一个想法,不同的受众:你指挥一个 AI 做真实工作,而不是只和它聊天。

这是整本书的枢纽。后面的几乎所有内容,都假设你能驾驭 general agent。Mode 1(一次性解决问题)和 Mode 2(制造永久 worker)本质上都是「你加一个 general agent」。就连可选的 Personal Agent Harnesses 过渡,也要通过其中一个工具来安装并运行它的 harness。所以这是你会反复使用的一项技能。之后,你在这里驾驭的同一个 general agent,会变成你用来构建 worker 的工具。还是同一个工具,只是任务变大了。

本节分三阶段

这里的课程沿着一条线推进:从你时刻握着工具,到精确指挥它,再到设计一个替你运行它的 loop,加固 loop 运行所在的 harness,让多个 loop 共享同一份记忆,最后衡量中心的检查器是否值得信任。

General Agents 路径图,从左到右分三阶段。左侧说明你从 Foundations 进入。阶段 1「Drive」是学习操作一个 general agent:Claude Code 和 OpenCode,或 Cowork 和 OpenWork。阶段 2「Direct」是 Spec-Driven Development。阶段 3「Delegate the loop」是 Loop Engineering。一个向前箭头通往 Mode 1 和 Mode 2。图注写着:先 Drive,再 Direct,最后 Delegate the loop。

阶段 1:驾驭

学会把 general agent 操作好。每个人都先从网页版开始,无需安装;然后选择适合自己的本地工具课程,以后再学其他课程。

  • 网页上的 General Agents:从这里开始,在浏览器中即可使用,无需安装。在 2026 年 7 月的网页工作界面上指挥第一个 agent,了解远程会话、文件位置、发送到手机的审批,以及用六部分视角理解任何 agent 产品。每个人都先学这门课,再选择下面的本地工具。
  • 开源 LLM:你的笔记本、服务器或集群,以及云端:这是编程路线的第一站。开源模型可以免费下载,真正的问题是在哪里运行。本课程介绍三个规模:用 Ollama 在自己的笔记本上运行;用 vLLM 在自己控制的 GPU 设备上同时服务 50 人;通过 OpenRouter 在云端使用无法自行托管的前沿开源模型。要记住一个核心观念:agent 由 harness 和可替换的大脑组成,大脑只是一个地址。第 1 部分可以独立学习,只需要一次免费安装。如果你尚未使用过 coding agent,其一条命令的安装步骤会为你启动一个。知识工作者可以完成第 1 部分,获得属于自己的私有 AI,然后直接转到 Cowork。
  • Agentic Coding:Claude Code 和 OpenCode:给和代码打交道的人。Plan mode、context 管理、规则文件、skills、subagents、connectors(MCP):怎样驾驭一个 coding agent,让它读取你的文件、提出计划、完成修改,并让你检查结果。
  • 面向专业人士的 Cowork 和 OpenWork:给其他所有人。同一类 agent,但放在为专业工作而建的桌面 app 里(文档、表格、幻灯片、研究),所以你不用碰终端,也能把它投入工作。
  • 网站设计:在这门课里,你不再只学机器本身,而是把它用在真实项目上。从空文件夹开始,为一位客户建一个网站,直到别人能在手机上打开它:在像素之前规划故事,把客户品牌当作规则而不是氛围,使用真实照片和视频,不把手机版当作补充,并用截图测试「看起来对不对」。它为后续阶段留下的核心观念是:品味现在是一份文件。能够操作上面任意一款工具后再学它。当你真正发布过作品,并亲自感受过工作会在哪里出错之后,就更容易理解 spec 和 loop 为什么重要。

阶段 2:指挥

驾驭能让你得到结果;指挥能让你每次都得到正确的结果。

  • Spec-Driven Development:停止给 agent 模糊指令,开始交给它一份写清楚的 spec:到底要做什么、作用在什么对象上、什么才算「完成」。清楚的 spec,是 agent 猜测和 agent 命中目标之间的差别;当你进入 Mode 2 时,它也是你首先带过去的东西。

阶段 3:委派 loop

这一阶段先用一张地图开场,再逐一构建地图中的内容:设计 loop,加固它运行所在的 harness,让多个 loop 共享同一份记忆,再用 eval 证明中心的检查器。最后一门课则回答它们共同引出的问题:一个 loop 值得信任之后,应该运行在哪里?

  • 四层结构:先读这门课,不到一小时即可读完。它是后续所有内容的地图:prompt、context、harness 和 loop 并不是四种任选其一的技能,而是四个层层嵌套的容器,每一层都有自己的工作单元。收获是一种习惯,而不是一种技巧。当 agent 花 40 分钟和 50 美元反复做同一件事时,你不再重写 prompt(这一层 10 秒就能改),而是开始追问究竟哪一层出了问题。它也会说明图该放在哪里,而且图并不是第五层。无需安装任何东西;只需要一个聊天标签页,以及一个你已经驾驭过的 agent。
  • Loop Engineering:从一直握着工具,跳到设计一个替你提示 agent 的系统。你会构建一个小 loop:它醒来,查看发生了什么变化,判断什么值得做,把每项工作交给 agent,检查结果,并且只在真正需要人做决定时才叫你。真正有价值的技能,从你写的 prompt,转移到你设计的 loop。这也是通往后续一切的自然入口。
  • Harness Engineering:这是同一次跨越里关乎信任的那一半。一个在你睡觉时仍在运行的 loop,需要有一层决定 agent 可以做什么、必须知道什么、工作如何得到证明,以及出错时会发生什么。这一层就是 harness,Claude Code 和 OpenCode 各自都自带一个。这门课教你有意识地打造它:权限墙、sandbox、自动检查,以及把每次抓到的错误都固化成规则、让它无法重犯的习惯。
  • Graph Engineering:这是记忆的那一半,也是一个 loop 不再够用时应学的课程。将任务分发给 20 个 agent 后,每个 agent 都从空白开始,重新发现另一个 agent 一小时前找到的内容:工作增加了,记忆没有。解决方法是不再把发现留在对话记录中,而是写成任何后续 agent 都能查询的有类型、有连接的记录:agent 会忘记,图不会。保持两张独立的图,一张记录尝试过的工作,一张记录已确立的事实;每个断言都附上证据;只给每个 worker 一小部分信息,而不是整体倾倒;让 reviewer 引用一条边,而不是给出意见。当你构建第二个 loop 时阅读本课,它也会坦诚说明什么时候不应该构建图。
  • 信任检查器:loop 正在运行,harness 正在证明工作,中心的检查器则输出 PASS 或 FAIL。但你如何知道检查器足够好?本课程教你使用 eval:根据真实失败构建一个小型测试用例文件夹,对 reviewer 进行多次评分而不是一次,用自己的判断校准它,并用结果阻止不合格的变更。它用文件、shell 和 jq,把「检查器说 PASS」变成一个你能够辩护的数字。
  • 离开笔记本:这是 runtime 决策。已经在笔记本上证明可行的 loop 仍被困在一台设备上。本课程把它迁移到真正运行的地方,可以是云端计划、托管 runtime,也可以是你自己的进程,而不丢失已经赢得的记录。它收尾了阶段 3:loop 在运行,harness 在守护,检查器值得信任,现在它也运行在一个不会随你休息而停止的地方。

四个词,一层套一层

上面三个阶段使用了行业中经常混用的四个词:promptcontextharnessloop。下面这张图展示了它们的结构,让你看清每门课负责哪一层。四层结构 会用大约 50 分钟把这套结构讲透,也是进入阶段 3 后首先应读的课程。

名为「四个词,一层套一层」的图示,展示四个嵌套的圆角矩形。最内层是第 1 层 prompt:你发送的消息,包括请求、示例和格式,由《AI Prompting in 2026》负责。外面的金色框是第 2 层 context:模型为生成一次响应而看到的一切,由 Agentic Coding 第 2 至 4 部分负责。再外面的陶土色框是第 3 层 harness:单次运行内的规则,包括权限、检查和恢复,由 Harness Engineering 负责。最外层是第 4 层 loop:包围一切的计划,它启动运行、评分结果,并记住多次运行之间的信息,由 Loop Engineering 负责。底部说明:好 prompt 在坏 context 中会失败,好 context 在裸 harness 中会失败,好 harness 没有 loop 就会闲置;网上大多数文章用同一支笔画第 3 和第 4 层,本书把它们分开,因为它们的失败方式不同。

定义工作单元负责它的课程
Prompt你发送的消息:请求、示例和格式。一条消息AI Prompting in 2026
Context模型为生成一次响应而看到的一切:文件、历史、规则和工具结果。窗口中一步步保留的内容Agentic Coding 第 2–4 部分
Harness单次运行内的规则:agent 可以做什么、工作如何得到证明、失败时会发生什么。一次运行Harness Engineering
Loop包围一切的计划:启动运行、评分结果,并记住多次运行之间的信息。数天内的多次运行Loop Engineering

这四个词不是一条直线上的步骤,而是一层套一层。好 prompt 在坏 context 中会失败,好 context 在裸 harness 中会失败,好 harness 没有 loop 就会闲置。这就是为什么一个在 demo 中有效的 agent,到了生产环境却经常失败:demo 只需要内层,而外层从未建立。问题不在模型,而在周围缺少的层。

本节有一门课不负责这四个词中的任何一个,这是有意的。Graph Engineering 根本不是第五层,而是一种拓扑:把许多这样的层栈连接起来,共享同一份记忆。它没有出现在表格中,因为在你运行多个 loop 之前,这个词没有价值;这也正是它排在四层之后的原因。

好 prompt 会给你一个聪明的答案。四层合在一起,才会给你一个可以发布的东西。四层结构 会逐层拆解,给出每一层的失败特征,并把「我的 agent 坏了」变成一个能定位到具体地址的问题。

你需要先具备什么

先完成 Foundations 这一节,尤其是 AI 时代如何思考(保住自己的判断力)和 技能与连接器(general agent 用来触达你的工具和数据的插件)。你不需要是程序员:如果你不是,就走 Cowork 和 OpenWork 这扇门,你完全可以继续。

它通向哪里

一旦你能驾驭、指挥、把 general agent 放进 loop 并加固它,整本书的其余部分就打开了。如果你想拥有一个运行在自己基础设施上的 worker,可选的 Personal Agent Harnesses 就在前面。然后就是整本书围绕的分叉:Mode 1:问题解决,用 general agent 一次性解决一个问题;以及 Mode 2:制造,构建一个永久 worker,让它永远替你解决这个问题。

本书的弧线一句话概括就是:Foundations 用来理解,General Agents 用来驾驭,两种 mode 用来投入工作。

先在浏览器中学习 网页上的 General Agents:每个人都能在第 1 天从这里开始,无需安装。然后,把 agent 带到自己的设备上时,再选择适合自己的入口:如果你和代码打交道,就选 Claude Code 和 OpenCode;否则选 Cowork 和 OpenWork