别被"agent"这个词唬住。它逃不掉四件事:会说话的模型、替它记账的会话、反复推进的循环、让它动手的工具。这是直觉;课程真正拆的六个模块,是从 Pi 源码来的,本节最后给你对上。
一
MODEL
模型:会说话,但转头就忘
大模型(就是 ChatGPT 背后那种)能听懂话、能回话、能决定"下一步该干嘛"。但它有个要命的毛病:转头就忘。每次找它,它都是一张白纸,上次聊过什么、干过什么,全不记得。所以光有模型,做不成 agent——它连"刚才干到哪了"都不知道。
二
SESSION
会话:替它记账(这门课第一站)
既然模型不记事,就得有人替它把发生过的事记下来,每次找它之前,把该让它知道的重新讲一遍。这本"记账的账本",就叫 Session(会话)。这正是我们第一章要拆的那一块——一本只能往后写、从不涂改的账本,加一根书签。
三
LOOP
循环:反复问、反复做
一个任务很少一步做完。Agent 干活的方式是转圈:
问模型该干嘛 → 照它说的动手 → 把结果记进账本 → 再问模型 → …… 直到事情做完。
这个不停转的圈,叫 Loop(主循环)。
四
TOOLUSE
工具:让它能动手
模型只会"说"。要让它真能读文件、跑命令、改代码,就得给它工具。模型说"我要读 login.ts",工具就真去把文件读回来。这块叫 ToolUse。
四件事怎么转起来
你让 agent「看看 login.ts 为什么报错」,它内部是这样走的:
1任务记进账本(会话)
2循环开始:把账本讲给模型听
3模型说"我得先读文件" → 工具去读 login.ts,结果记回账本
4循环再转:模型看到文件内容,说"第 42 行少了 await"
5做完了,循环停下
那课程为什么分了六章?
上面四件事,是任何 agent 都逃不掉的最小骨架——这是直觉,帮你有个整体画面。但我们真正一章一章拆的,是从 Pi 源码结构里读出来的模块:它们在源码里各有各的地盘,分在不同的文件和目录,不是随口一分。
| 直觉里的四件事 | Pi 源码里对应的模块 |
|---|---|
| 会话 · 记事 | Session(怎么存) + Context(每次到底把哪些发给模型、怎么压) |
| 循环 | Loop |
| 工具 | ToolUse |
| 模型 · 说话 | Provider(一套代码接不同家的模型) |
| —— | 人设(系统提示 + 技能,让它从”会说话”变成”会干活”) |
| —— | 收官(把上面几块拼起来,跑通一个真实任务) |
多出来的 Context、Provider、人设,就是把”记事""说话""到底怎么干活”这几件做得更结实的功夫,源码里各自有块——我们照它的分法学。
带走这一句
四件事帮你记住"是什么",六个模块是代码里真实的接缝。后面每一章,拆的都是后者。
下一章
这几件事里,我们先啃会话(Session)——因为其它几块都要往账本里读写,账本是地基。
下一章第一件事,是先把它玩坏。