序章

干嘛写这本手册

1. 你是不是也遇到过这种情况

你想认真学一点 AI,于是打开一篇“零基础攻略”,刚看几段,Prompt、Context、RAG、MCP、Skill、Hook……各种单词一起冒了出来,这些是什么?

你想问别人,又怕问题太基础,显得自己什么都不懂。问豆包和 D 老师,说得很详细,但问一个忘一个,很难记住;你转头看到有人推荐一本讲 Claude Code 的书,买回来翻开第一章发现,作者默认读者会编程、懂命令行,也知道模型怎样调用工具,这本书好像从一开始就没有写给你。

更让人不安的是,好像全世界一夜之间突然都懂 AI 了,互联网上所到之处都在讨论 Codex、Claude Code,谁家模型又升级、什么新开源工具在 GitHub 斩获多少颗星、Token 又蹬没了要升级什么订阅……而你可能只会用 DeepSeek、豆包、Kimi 聊天、写作、整理文件。

好像所有人都早早进入了一个你没在的圈子,而他们又在告诉你“现在不学 Agent 就要被时代淘汰了”,可 Agent 到底是什么,还是一团雾。

如果你有过这种感受,请不要怀疑自己。

2. 看不懂没关系,谁让 Agent 是从编码圈火起来的呢

这和 AI Agent 近几年的软件发展路线有关。

Agent 不是个新词。早在 1990 年代的人工智能论文中,人们就已经在讨论它。但到了 2025 年,最引人注意的变化发生在 AI Coding(AI 编程)领域。

Coding Agent(编程智能体)突然变得非常耀眼,也第一次让很多人直观看见“AI 不只回答,还能动手做事”。

在法律、医疗、管理等领域,让 Agent 独立执行任务要谨慎得多。因为这些复杂场景下“做对了没有”往往很难立刻判断,错误还可能造成严重后果。

但编程不一样,它在大模型技术应用上有得天独厚的条件:代码和文件都在电脑里,编辑器、终端和测试工具已经齐全;程序能不能运行、测试有没有通过,也会很快返回结果。Agent 因而可以反复执行“读取—修改—运行—检查”这套过程。

编程一定不是唯一适合 Agent 的领域,但它是当时最容易把 Agent 能力做成面向用户软件、也最容易通过现场演示让人看到成果的领域之一。

很多人第一次看到 Agent,是在这样的画面里:左边是文件目录,中间是代码编辑器,下面是终端,旁边还有一个对话框。用户说一句要求,AI 就开始读文件、改代码和运行测试。

久而久之,“Agent”这个很宽的概念,在互联网传播中被压缩成了“一个长得像代码编辑器、会自己敲命令的软件”。

这是一种由爆款 Agent 软件形成的印象,并不是 Agent 的完整定义。

Vibe Coding(氛围编程)一词的推波助澜

2025 年 2 月 2 日,科技领域的大红人计算机科学家 Andrej Karpathy(安德烈·卡帕西)在 X 上描述了一种新的编程体验,取名叫 Vibe Coding,中文常译作“氛围编程”,我认为译作“大白话编程”可能更好理解。

他的做法大致是:用自然语言,也就是大白话,告诉 AI 想做什么;让 AI 生成和修改代码;如果程序报错,就把报错继续交给 AI。人在这个过程中很少查看每一处代码改动,更关心程序最后的交付结果。

后来,这个词越用越宽,几乎所有“用自然语言让 AI 写代码”的做法都可能被叫作 Vibe Coding。

这个说法形象又好记,加上许多没有编程基础的人第一次发现,自己只要能说清楚想要什么,也能尝试做出一个网页、一个小工具或一个原型。Coding Agent 的能力也非常容易被拍成视频、写成帖子和当场演示:说出要求—Agent 动手—屏幕上出现结果。于是它很快就风靡了起来。

通过这种大规模的公众演示,Agent 从工程圈里的概念,变成了普通人也能感受到的软件体验,毕竟谁不想要一个钢铁侠的贾维斯呢?

但 Coding Agent 的走红也带来了一个传播问题。

最早编写教程、制作 Skill、贡献开源工具的人,有很大一部分具备软件开发背景。他们写下 Harness、Hook、Runtime、Sandbox 或 Terminal 时,通常不是故意卖弄,只是在使用自己的日常词汇。

可是,普通人不懂啊。

面向开发人员的实战攻略和面向普通人的入门内容,在互联网中被硬生生混进了同一个信息流。这也造成了这样的情况:一个新人用户只是想学学如何让 AI 整理资料和处理文件,找到的攻略却像是一本写给开发人员的工具书。

就像你和三体人一起吃自助,席上全是一碗碗水。三体人已经泡了进去,你找了很久也没有看到一块饼,甚至怀疑自己是不是也应该泡泡水。

于是,这本手册出现了——一块给 Agent 新人用户准备的可口小饼

3. 这本手册写给谁

写给希望学习或正在学习 AI Agent、没有编程或 AI 技术背景、分不清基础概念的 AI 应用新人用户。

这本手册主要做两件事:

  1. 说明重点概念的功能作用,把容易混淆的概念区分开来;

  2. 每章用一个不同的实际任务解释概念,再在第十章用一个完整项目把它们串起来。

所以这本手册首先是一份概念扫盲,但它不会把几十个词排成一本冷冰冰的小字典,而是在每章给你一个职业身份和一个模拟任务,沉浸式体验“为了达成任务目标,你让某个 Agent 执行了什么动作”,并在过程中理解 Agent 相关的核心概念。边干边学,也更有趣味一些。

等完整看过一遍这个手册,你再次看到有人说“这个 Agent 按照 Skill 中保存的做法,通过 MCP 接入的工具完成了任务”,你至少能听出:Agent 在推进任务,Skill 提供一套可复用的做法,MCP 负责连接外部工具和资料。

4. 整本手册的大目录

起点:我只会和 AI 聊天
          │
          ▼
第一站 认识 Agent
第 1 章:Agent 到底是什么,以及模型、组成部分和软件形态的关系
          │
          ▼
第二站 看懂 Agent 接到的信息
第 2 章:Prompt(提示)、Instruction(指令)、Context(上下文)、Token(词元)与 Context Window(上下文窗口)
第 3 章:Data(数据)、Knowledge Base(知识库)、Memory(记忆)、Retrieval(检索)与 RAG(检索增强生成)
          │
          ▼
第三站 看懂 Agent 怎样连接外部能力并推进任务
第 4 章:MCP(模型上下文协议)、Plugin(插件)、Connector(连接器)与 Skill(技能包)
第 5 章:Workflow(工作流)、Loop(循环)、State(状态)、Subagent(子 Agent)与 Multi-Agent(多 Agent 系统)
          │
          ▼
第四站 学会限制 Agent,并检查它的结果
第 6 章:Permission(权限)、Sandbox(沙箱)、Guardrail(护栏)、人工确认、试错与恢复
第 7 章:Hallucination(幻觉)、Completion Criteria(完成标准)、Eval(评估)、Trace(过程追踪)与 Benchmark(基准测试)
          │
          ▼
第五站 看懂 Agent 背后的运行系统和模型开发
第 8 章:Harness(智能体运行框架)、Runtime(运行时或运行环境)与 Compaction(上下文压缩)
第 9 章:使用 AI 和开发 AI 的区别,以及训练、微调、部署等模型词
          │
          ▼
第六站 用一次完整任务完成总复习
第 10 章:用一次大型行业研究串起全部概念
          │
          ▼
附录一:主要 AI 品牌和开源 Agent 项目
附录二:互联网、GitHub、行业、技术与社区黑话
          │
          ▼
终点:能判断、会交代、敢检查,不再被陌生的专业名词挡住学习之路

注意:一定不要被目录里这些单词吓住,囫囵看一遍,懂个大概,再去看网上的帖子就会清楚很多。小手册在,随用随查。