第十章

用一次大型行业研究,把全书概念串起来

1. 本章要复习的概念

用一次完整的办公任务,把前文的核心概念快速过上一遍,只要大概了解:任务进行到哪一步,会遇到什么概念,它在这里起什么作用。

2. 模拟任务:为一家准备 IPO 的企业制作行业报告

假设你是一名行业顾问,正在协助一家准备 IPO 的消费企业制作行业报告。报告需要说明行业怎样划分、市场规模有多大、未来为什么增长、主要竞争者是谁,以及消费者需求发生了什么变化。

客户提供了企业介绍、访谈记录、业务资料和旧版研究;你还要查找政府数据、行业报告、竞争企业公开文件,并且进行行业专家访谈和用户反馈。最终交付物包括报告初稿、数据表、证据索引和待确认问题清单。所有关键说法都要有依据,Agent 可以协助研究和写作,但最后的专业判断和正式交付由你负责。

3. 先选择用什么来做

  • AI Application(AI 应用):新人用户实际打开和使用的 AI 软件,既包括以聊天为主的 Chatbot 应用,也包括能连续执行任务的 Agent 软件。

  • Chatbot(聊天机器人):以对话问答为中心的 AI 应用形态,适合临时问答、讨论思路和起草短文,不直接处理设备中的文件。

  • Agent(智能体):是围绕目标工作,由模型参与判断,能够使用工具,并根据行动结果继续、调整或停止的软件系统。

  • Model(模型):一种经过训练、能够处理信息的程序,装在 AI 应用软件里;负责读懂要求、分析资料、生成内容并参与判断下一步。

  • Tools(工具):Agent 可以调用的具体能力,在本项目中包括读取文件、搜索网页、处理表格和创建报告。

4. 把项目交代清楚

你向 Agent 说明研究对象、报告用途、交付物、截止时间和工作要求。

  • Goal(目标):完成一套可供项目组审核的行业报告、数据表、证据索引和待确认清单。

  • Prompt(提示):你在对话框里输入的整段项目说明。

  • Instruction(指令):Prompt 中要求 Agent 遵守的具体做法。

5. 划定可以操作的范围

你建立单独的项目工作区,只开放需要处理的资料和交付目录,并选择越界时先申请批准。

  • Permission(权限):你在界面上授予 Agent 多大的操作权。

  • Sandbox(沙箱):系统对 Agent 启动的本机命令施加文件、程序和网络限制。

  • Control(控制):权限、沙箱、审批和停止条件共同组成的任务控制方式。

6. 接入外部资料和固定工作方法

客户资料放在公司云盘里,部分数据还要从外部服务取得;同类行业研究又有一套长期使用的分析方法。

  • Connector(连接器)/Plugin(插件):在 Agent 软件中连接其他现成服务的入口或增加新的功能。

  • MCP(模型上下文协议):让 Agent 软件与外部资料和能力按照共同规则连接。

  • MCP Server(MCP 服务器):按照 MCP 向 Agent 提供资料或可调用能力的程序。

  • API(接口):数据服务原有的软件接口,MCP Server 在后台也可能通过它取得数据。

  • Skill(技能包):一类任务可以反复使用的规则、步骤和参考资料,比如保存“行业定义—市场规模—增长动力—竞争格局—用户需求—证据核对”这套固定研究做法。

7. 整理已有资料

项目正式开始后,你先把客户材料和长期积累的研究资料放到合适的位置。

  • Data(数据):本项目中的企业介绍、统计表、访谈记录、行业报告和公开文件。

  • Knowledge Base(知识库):长期保存并组织研究资料的项目文件夹、Obsidian 库或企业资料库。

  • Memory(记忆):Agent 软件为以后任务保留的用户信息,例如你长期使用的报告语气和写作偏好。

8. 让模型拿到当前需要的信息

Agent 不会把所有资料永远同时摊在模型面前,而是根据当前任务准备这一轮要用的信息。

  • Context(上下文):模型当前收到的任务要求、资料、Skill 和中间结果。

  • Token(词元):模型处理文字和其他内容时使用的基本片段。

  • Context Window(上下文窗口):模型一次能够容纳的 Token 总量。

9. 寻找报告需要的证据

Agent 开始查找市场规模、政策变化、竞争企业和消费者需求等资料。

  • Search(搜索):日常说法,常指从公开互联网查找最新政策、统计公报、竞争企业公告和行业报告。

  • Retrieval(检索):从指定范围中找出并取回与当前问题相关的内容。这个范围既可以是公开互联网,也可以是客户文件或知识库;使用网页搜索寻找并取回资料,也属于 Retrieval。

  • RAG(检索增强生成):Agent 先检索证据,再把证据交给模型,据此生成报告内容。

10. 安排研究、分工和补证

你让 Agent 先建立资料清单,再分别研究市场、竞争和用户,最后汇总成稿。

  • Workflow(工作流):从资料整理、分项研究到汇总成稿的固定任务安排。

  • State(状态):已经完成什么、还缺什么以及下一步做什么的项目进度。

  • Subagent(子 Agent):由主 Agent 调用、负责一个子任务的 Agent,例如一个专门研究竞争企业,一个专门研究用户。

  • Multi-Agent(多 Agent 系统):主 Agent 与多个子 Agent 分工协作的整套系统。

  • Loop(循环):发现市场规模缺少可靠年份后,重新检索、核对口径、修改并再次检查。

11. 管住动作,并给修改留下退路

项目越大,越要防止 Agent 误改客户材料、漏掉审批,或者把已经完成的版本越改越乱。

  • Guardrail(护栏):检查数字是否缺少来源、是否出现禁用表述,以及动作是否超出规定范围。

  • Hook(钩子):在写入文件、提交报告等固定时点自动触发检查程序。

  • Human-in-the-loop(人工参与):修改客户材料、向外发送或正式交付前,Agent 停下来请你批准。

  • Fork(分叉):从同一份研究进度分出“投资者版”和“管理层版”两条写作路线。

  • Checkpoint(检查点):项目进行到可靠阶段时保存的完整备份。

  • Rollback(回滚):某个版本改坏后,恢复到之前保存的检查点。

12. 让长任务持续跑下去

这项研究可能持续数周,Agent 软件需要组织不同部分,并处理上下文越来越长的问题。

  • Harness(智能体运行框架):组织模型、指令、上下文、可调用能力、循环和权限的外层系统。

  • Runtime(运行时或运行环境):本次任务实际可以使用的电脑、文件、软件、网络和授权条件。

  • Compaction(上下文压缩):对话和任务记录太长时,把历史整理成较短记录,再继续工作。

13. 验收报告

初稿完成后,你开始检查数字、依据、口径和结论。

  • Hallucination(幻觉):报告写出了资料中没有依据的数字、事实或结论。

  • Completion Criteria(完成标准):项目组提前规定的验收条件,例如关键数字有来源、统计口径一致、待确认问题已经标出。

  • Eval(评估):按照完成标准检查这份报告是否达到要求。

  • Trace(过程追踪):回看 Agent 读取了什么资料、调用了什么能力,以及内容是怎样生成的。

  • Benchmark(基准测试):使用一批固定研究任务和同一套标准,反复比较不同 Prompt、Skill、模型或 Agent 的表现。

14. 干完活后,有空看看任务背后的模型工作

这些工作不是你每次做行业报告都要操作的步骤,但它们解释了模型怎样来到 Agent 软件中。

  • Training(训练):模型开发人员使用大量数据,让模型形成处理信息的基础能力。

  • Fine-tuning(微调):在已有模型上继续使用更有针对性的数据训练,让它更适合某类任务。

  • Parameter / Weight(参数 / 权重):模型在训练和微调中逐步调整并保存下来的大量内部数值。

  • Deployment(部署):把训练完成的模型安装并运行在服务器或其他设备上,供 Agent 软件调用。

  • Inference(推理运行):你交代行业研究任务后,已经部署好的模型实际处理输入并生成结果。

  • Local Model(本地模型):运行在企业或个人自己管理的设备上的模型。