1. 本章要复习的概念
用一次完整的办公任务,把前文的核心概念快速过上一遍,只要大概了解:任务进行到哪一步,会遇到什么概念,它在这里起什么作用。
2. 模拟任务:为一家准备 IPO 的企业制作行业报告
假设你是一名行业顾问,正在协助一家准备 IPO 的消费企业制作行业报告。报告需要说明行业怎样划分、市场规模有多大、未来为什么增长、主要竞争者是谁,以及消费者需求发生了什么变化。
客户提供了企业介绍、访谈记录、业务资料和旧版研究;你还要查找政府数据、行业报告、竞争企业公开文件,并且进行行业专家访谈和用户反馈。最终交付物包括报告初稿、数据表、证据索引和待确认问题清单。所有关键说法都要有依据,Agent 可以协助研究和写作,但最后的专业判断和正式交付由你负责。
3. 先选择用什么来做
AI Application(AI 应用):新人用户实际打开和使用的 AI 软件,既包括以聊天为主的 Chatbot 应用,也包括能连续执行任务的 Agent 软件。
Chatbot(聊天机器人):以对话问答为中心的 AI 应用形态,适合临时问答、讨论思路和起草短文,不直接处理设备中的文件。
Agent(智能体):是围绕目标工作,由模型参与判断,能够使用工具,并根据行动结果继续、调整或停止的软件系统。
Model(模型):一种经过训练、能够处理信息的程序,装在 AI 应用软件里;负责读懂要求、分析资料、生成内容并参与判断下一步。
Tools(工具):Agent 可以调用的具体能力,在本项目中包括读取文件、搜索网页、处理表格和创建报告。
4. 把项目交代清楚
你向 Agent 说明研究对象、报告用途、交付物、截止时间和工作要求。
Goal(目标):完成一套可供项目组审核的行业报告、数据表、证据索引和待确认清单。
Prompt(提示):你在对话框里输入的整段项目说明。
Instruction(指令):Prompt 中要求 Agent 遵守的具体做法。
5. 划定可以操作的范围
你建立单独的项目工作区,只开放需要处理的资料和交付目录,并选择越界时先申请批准。
Permission(权限):你在界面上授予 Agent 多大的操作权。
Sandbox(沙箱):系统对 Agent 启动的本机命令施加文件、程序和网络限制。
Control(控制):权限、沙箱、审批和停止条件共同组成的任务控制方式。
6. 接入外部资料和固定工作方法
客户资料放在公司云盘里,部分数据还要从外部服务取得;同类行业研究又有一套长期使用的分析方法。
Connector(连接器)/Plugin(插件):在 Agent 软件中连接其他现成服务的入口或增加新的功能。
MCP(模型上下文协议):让 Agent 软件与外部资料和能力按照共同规则连接。
MCP Server(MCP 服务器):按照 MCP 向 Agent 提供资料或可调用能力的程序。
API(接口):数据服务原有的软件接口,MCP Server 在后台也可能通过它取得数据。
Skill(技能包):一类任务可以反复使用的规则、步骤和参考资料,比如保存“行业定义—市场规模—增长动力—竞争格局—用户需求—证据核对”这套固定研究做法。
7. 整理已有资料
项目正式开始后,你先把客户材料和长期积累的研究资料放到合适的位置。
Data(数据):本项目中的企业介绍、统计表、访谈记录、行业报告和公开文件。
Knowledge Base(知识库):长期保存并组织研究资料的项目文件夹、Obsidian 库或企业资料库。
Memory(记忆):Agent 软件为以后任务保留的用户信息,例如你长期使用的报告语气和写作偏好。
8. 让模型拿到当前需要的信息
Agent 不会把所有资料永远同时摊在模型面前,而是根据当前任务准备这一轮要用的信息。
Context(上下文):模型当前收到的任务要求、资料、Skill 和中间结果。
Token(词元):模型处理文字和其他内容时使用的基本片段。
Context Window(上下文窗口):模型一次能够容纳的 Token 总量。
9. 寻找报告需要的证据
Agent 开始查找市场规模、政策变化、竞争企业和消费者需求等资料。
Search(搜索):日常说法,常指从公开互联网查找最新政策、统计公报、竞争企业公告和行业报告。
Retrieval(检索):从指定范围中找出并取回与当前问题相关的内容。这个范围既可以是公开互联网,也可以是客户文件或知识库;使用网页搜索寻找并取回资料,也属于 Retrieval。
RAG(检索增强生成):Agent 先检索证据,再把证据交给模型,据此生成报告内容。
10. 安排研究、分工和补证
你让 Agent 先建立资料清单,再分别研究市场、竞争和用户,最后汇总成稿。
Workflow(工作流):从资料整理、分项研究到汇总成稿的固定任务安排。
State(状态):已经完成什么、还缺什么以及下一步做什么的项目进度。
Subagent(子 Agent):由主 Agent 调用、负责一个子任务的 Agent,例如一个专门研究竞争企业,一个专门研究用户。
Multi-Agent(多 Agent 系统):主 Agent 与多个子 Agent 分工协作的整套系统。
Loop(循环):发现市场规模缺少可靠年份后,重新检索、核对口径、修改并再次检查。
11. 管住动作,并给修改留下退路
项目越大,越要防止 Agent 误改客户材料、漏掉审批,或者把已经完成的版本越改越乱。
Guardrail(护栏):检查数字是否缺少来源、是否出现禁用表述,以及动作是否超出规定范围。
Hook(钩子):在写入文件、提交报告等固定时点自动触发检查程序。
Human-in-the-loop(人工参与):修改客户材料、向外发送或正式交付前,Agent 停下来请你批准。
Fork(分叉):从同一份研究进度分出“投资者版”和“管理层版”两条写作路线。
Checkpoint(检查点):项目进行到可靠阶段时保存的完整备份。
Rollback(回滚):某个版本改坏后,恢复到之前保存的检查点。
12. 让长任务持续跑下去
这项研究可能持续数周,Agent 软件需要组织不同部分,并处理上下文越来越长的问题。
Harness(智能体运行框架):组织模型、指令、上下文、可调用能力、循环和权限的外层系统。
Runtime(运行时或运行环境):本次任务实际可以使用的电脑、文件、软件、网络和授权条件。
Compaction(上下文压缩):对话和任务记录太长时,把历史整理成较短记录,再继续工作。
13. 验收报告
初稿完成后,你开始检查数字、依据、口径和结论。
Hallucination(幻觉):报告写出了资料中没有依据的数字、事实或结论。
Completion Criteria(完成标准):项目组提前规定的验收条件,例如关键数字有来源、统计口径一致、待确认问题已经标出。
Eval(评估):按照完成标准检查这份报告是否达到要求。
Trace(过程追踪):回看 Agent 读取了什么资料、调用了什么能力,以及内容是怎样生成的。
Benchmark(基准测试):使用一批固定研究任务和同一套标准,反复比较不同 Prompt、Skill、模型或 Agent 的表现。
14. 干完活后,有空看看任务背后的模型工作
这些工作不是你每次做行业报告都要操作的步骤,但它们解释了模型怎样来到 Agent 软件中。
Training(训练):模型开发人员使用大量数据,让模型形成处理信息的基础能力。
Fine-tuning(微调):在已有模型上继续使用更有针对性的数据训练,让它更适合某类任务。
Parameter / Weight(参数 / 权重):模型在训练和微调中逐步调整并保存下来的大量内部数值。
Deployment(部署):把训练完成的模型安装并运行在服务器或其他设备上,供 Agent 软件调用。
Inference(推理运行):你交代行业研究任务后,已经部署好的模型实际处理输入并生成结果。
Local Model(本地模型):运行在企业或个人自己管理的设备上的模型。