第九章

看懂开发人员在做什么,以及那些模型开发词

1. 本章要说的概念

Training(训练)、Fine-tuning(微调)、Parameter / Weight(参数 / 权重)、Inference(推理运行)、Deployment(部署)和 Local Model(本地模型)。

2. 先分清:使用 AI 和开发 AI,是两种工作

你是不是也遇到过这种情况:本想学学怎样使用 Agent,找到一份很受欢迎的攻略阅读,却发现它一直在讲 Agent 的设计原理、运行结构、不同用户的权限、系统故障,以及怎样把整套服务部署上线。于是你很困惑,这些该不该学?

其实这类内容是面向开发人员的学习攻略,目标是帮助他们学会搭建和维护一套可以反复运行、供许多用户使用的 Agent 系统。

所以,如果说新人用户主要在使用 AI 应用或 Agent 软件,开发人员则可能在开发 AI 应用、搭建 Agent 或训练模型

角色 主要目标 交付结果 角色任务
使用 AI 应用或 Agent 软件的用户 使用现成的 AI 应用或 Agent 完成自己的任务 报告、视频、邮件、分析结果等自己的工作成果 我用 WorkBuddy 办公,用 Seedance 生成视频、制作漫剧
AI 应用或 Agent 开发人员 基于现成模型开发并维护 AI 应用或 Agent 一套供用户或企业反复使用的 AI 应用或 Agent 产品 我把模型做成一套别人可以使用的 AI 应用或 Agent 产品
模型开发人员 训练、调整和优化模型本身 可以被各种 AI 应用或 Agent 系统调用的新模型或模型版本 我把模型训练好,它以后可以成为 Agent 的核心

对于新人用户来说,了解一些开发人员常说的核心概念,能帮助你理解不同 AI 应用和 Agent 软件的特点与现状。就像购买化妆品时了解一点工艺成分,买汽车时了解一点技术和结构,会帮助你更好地选择和使用这些商品。了解这些,并不意味着你要去做配方师或汽车开发人员;有些概念需要用上,有些需要记住,还有些知道大概意思就够了。

本章的概念,基本属于新人用户混个脸熟就够了的这一档。

3. 模拟任务:一套客服 Agent,是怎样从模型走到用户面前的

一家公司要做一套 To B 的客服 Agent:用户输入“付款后一直没有到账”,再附上一张订单截图,Agent 就需要看懂文字和图片,查询该公司的服务资料与订单状态,最后生成回复草稿。

在这套客服 Agent 系统中,模型开发人员需要提供能够处理文字和图片的模型;Agent 开发人员再把模型接入客服系统,连接企业服务资料和订单查询服务,加入回复要求、权限与验收机制。客服人员最后使用这套 Agent 系统,处理具体问题并确认回复。

4. 模型的类型:Foundation Model(基础模型)、LLM(大语言模型)、Multimodal Model(多模态模型)和 Reasoning Model(推理模型)

这四个名称会有重叠,并不是四个互不相干的品类。同一个模型可以同时属于其中几类。例如,GPT-5.6 Sol 既是大语言模型,也能读取图片,同时强调复杂推理能力。

  • Foundation Model(基础模型):是在大规模、多种资料上训练出来,可以继续适应许多任务的模型。GPT、Claude、Gemini 和通义千问等通用模型家族,都有可以作为基础模型使用的成员,例如 GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.6 Flash、Qwen3.5-Plus。开发人员可以在它们之上继续搭建聊天、写作、编程或客服 Agent。

  • Large Language Model / LLM(大语言模型):主要处理语言及相关任务,可以理解文字并生成内容。常见例子包括 GPT-5.6 Luna、Claude Haiku 4.5、DeepSeek V4 和 Qwen3.5-Plus。现在不少 LLM 还能读取图片,所以“大语言模型”不再必然等于“只能处理文字”。

  • Multimodal Model(多模态模型):可以处理不止一种信息形式。比如 GPT-5.6 系列、Claude Opus 5、Gemini 3.6 Flash 和 Kimi K2.5都可以同时处理文字和图片;有些多模态模型还会继续处理音频或视频。

  • Reasoning Model(推理模型):强调处理复杂问题和多步推理的能力。典型例子包括 GPT-5.6 Sol、DeepSeek-R1、Gemini 2.5 Pro 和 Claude Opus 5(开启 Extended Thinking 后)。这个名称更像对模型能力和定位的概括,不代表它与 LLM、多模态模型完全分家。

备注:不是每家公司都单独做一条“推理模型”产品线。像 Anthropic 就是把深度推理做成 Claude 主线模型(Sonnet、Opus 等)里可以开关的一种模式,也就是 Extended Thinking(扩展思考);开启后,同一个模型会花更多步骤逐步推理再给出答案。

5. Training(训练):模型的能力是怎样形成的

Training(训练)是开发人员让模型从大量示例中逐步形成能力的过程。模型在刚开始训练时,内部有大量尚未调好的数字设置。训练开始后,大致会反复发生四件事:

  1. 开发人员把文字、图片、代码等训练材料交给模型;

  2. 模型根据当前状态尝试预测或生成结果;

  3. 训练程序把模型的结果与正确内容进行比较;

  4. 如果结果有偏差,就把模型内部的大量数字分别调整一点,再进入下一轮。

这个过程会重复许多次。训练结束后,那些调整过的数字会随模型一起保存下来,模型也就形成了理解语言、识别图片或生成内容等能力。

Pre-training(预训练)是模型前期进行的大规模训练。这里的“预”是相对于后面的微调、强化学习等后续训练而言。预训练使用的材料范围通常很广,目的是先形成比较通用的语言、知识和图像处理能力,最后得到一个可以继续调整和使用的基础模型。

开发人员谈训练时,经常提到 Parameter(参数)和 Weight(权重)。它们不是两种互不相干的东西:

  • Parameter(参数):是模型内部所有可以通过训练调整并保存下来的数字设置。一个大模型可能有几十亿甚至更多参数。它们共同影响模型怎样处理输入、最后生成什么结果。

  • Weight(权重):模型会先把文字或图片转成数字,再一层层进行计算。计算时,每个输入数字都会乘上一个 Weight;Weight 较大,这个数字对下一步计算的影响就更强。大量 Weight 一起工作,模型才会逐渐识别词语、句子和图片之间的关系。

客服 Agent 的开发团队通常不会从头完成预训练,而是选择模型厂商已经训练好的成熟基础模型,再把它接入客服系统。

6. Fine-tuning(微调):在已有模型上继续训练

Fine-tuning(微调) 是在一个已经训练好的模型上,再用一批更贴近具体任务的数据继续训练。训练程序会反复把这些样本交给模型,并根据目标答案或人类评价调整模型参数。微调完成后,模型处理同类新问题时,会更倾向于采用训练数据中反复示范的最优做法。

  • SFT(Supervised Fine-tuning,监督微调):是直接用示范答案训练模型。例如,样本的一边写着“用户付款后一直没有到账”和当时的订单状态,另一边放入客服人员认可的回复。成千上万组这样的样本都在告诉模型:遇到这种输入,希望你这样回答。模型会逐步学会公司的表达方式、回复顺序和处理要求。

  • RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习):则会让模型针对同一个问题生成多个回答,再请人比较哪一个更好。例如,一个回答信息准确但很生硬,一个回答解释清楚又符合公司的客服要求,另一个回答没有依据却擅自承诺退款。审核人员给这些回答排序,训练系统再把这种人的选择变成调整模型的依据,让模型以后更容易给出人们偏好的回答。

7. Deployment(部署)与 Inference(推理运行):从训练好的模型到一次客服回复

模型训练结束后,得到的是一套已经保存好参数的模型。还要为它准备计算设备和运行软件,把它启动成可以接收请求的模型服务,AI 应用或 Agent 系统才能调用。这个让模型进入可用状态的过程,叫 Deployment(部署)

如果选择公司自主管理部署,公司需要取得允许自行部署的模型,常见选择是开放权重模型,再把它安装到自己控制的服务器上。服务器可以位于公司的机房,也可以是公司租用并自行管理的云服务器。公司还要准备足够的计算设备,安排开发和运维人员负责安装、更新、安全、权限及故障处理。这样做能让公司对运行环境和数据流向有更多控制,但硬件、人才和时间都是成本。

公司评估后发现,这套客服 Agent 需要尽快上线,业务对模型的要求也没有特殊到必须自行维护一整套运行系统,所以自主管理部署就显得有些太重了。于是,公司决定采购模型厂商托管的模型云端服务。模型厂商把模型部署在自己管理的云端服务器集群上,并提供调用地址、账号权限和接入说明。公司的开发人员把这些信息配置到客服系统中,客服 Agent 就能通过网络把用户问题送给云端模型,再取回处理结果。这样公司不用自己购买 GPU、安装模型和维护运行环境,可以更快上线。

客服 Agent 上线后,用户提交“付款后一直没有到账”和一张订单截图。客服 Agent 把需要理解的内容送给模型;模型读取文字和图片,计算并生成回复草稿,这个从“收到本次输入”到“算出本次输出”的过程,叫 Inference(推理运行)

Temperature(温度) 是 Inference 时可以使用的一项设置,用来调节模型生成内容的变化程度。温度较低,回答通常更稳定、相似;温度较高,表达可能更多样。客服回复重视稳定和一致,往往会采用较低的温度。

8. Distillation(蒸馏)与 Quantization(量化):让模型运行得更轻

能力较强的大模型通常需要更多计算资源,处理大量请求时,速度和费用可能成为问题。开发人员常用 Distillation(蒸馏)和 Quantization(量化)让模型运行得更轻。

Distillation(蒸馏) 训练出一个新的小模型。开发人员先让较小的模型学习较大模型的输出和判断方式,再根据两者的差距不断调整小模型。较大的模型常被称为 Teacher Model(教师模型),学习它的小模型常被称为 Student Model(学生模型)。训练完成后,学生模型通常运行更快、占用资源更少,但能力可能不如教师模型完整。

Quantization(量化) 主要改变模型参数的保存和计算精度,让现有模型用更省空间的数字形式运行。例如,原来需要用 16 位数字保存的参数,可以改用 8 位或 4 位数字表示。参数数量可能没有减少,但每个参数占用的空间变小了,模型文件和运行时占用的内存随之减少,在合适的硬件上也可能运行得更快。精度压得越低,模型能力受到影响的可能性也会增加。

9. Local Model(本地模型)、Open Weights(开放权重)和 GPU(图形处理器):如果公司自己运行模型

把任务中公司的要求换一个条件:如果公司对信息和数据安全的要求极高,客服记录、订单信息和用户资料都要留在公司内部,包括客服 Agent 在内的所有模型服务也必须部署在本地。这意味着,公司只能进行自主管理部署,要在自己的机房和内部网络中把模型运行起来,并负责相应的计算设备、安装、更新、权限、安全和故障处理。此时,下面几个词就经常会一起出现:

  • Local Model(本地模型) 是运行在个人或公司本地设备上的模型。在这个任务里,它运行在公司的服务器上,客服 Agent 通过内部网络调用。

  • Open Weights(开放权重):模型训练时,会不断调整内部数以亿计的数字。训练完成后,这些数字被保存成文件;模型每次运行,都要读取它们。这些数字叫 Weight,保存它们的文件就是权重文件。Open Weights 表示模型厂商允许外部用户下载这些文件。公司取得权重文件后,就可以用自己的软件和服务器加载模型,让它在公司内部运行。

  • GPU(图形处理器) 是运行模型常用的计算设备。模型越大,需要的 GPU 数量、运行内存和计算能力通常越高。

企业本地部署:以完整版 DeepSeek-R1 为例,它有 6710 亿个参数,本地运行需要多张价格昂贵的服务器级 GPU。服务器、存储等硬件投入往往就会达到数百万元,再加上机房、电力、散热和维护,通常只有大型企业和机构才有这样的需求和投入能力。较小的蒸馏版或量化版模型需要的 GPU 会少很多,更适合中小型机构本地运行。这也是很多企业不会一上来就部署完整版大模型的原因。

模型和 GPU 准备好后,开发人员还要搭建 Environment(环境),也就是模型运行所需的操作系统、驱动、软件和配置。它和第八章的 Runtime 说的是同一类东西,只是站的位置不同:Environment 是开发人员搭建模型服务时准备的底层系统条件,Runtime 则是 Agent 实际执行一次任务时能用到的整套条件(往往就建立在这套 Environment 之上)。

为了方便安装、更新和迁移,还可能使用 Container(容器),把模型程序、相关软件和配置整理成一个可以重复部署的运行单元。

这样一来,整个过程就连起来了:公司取得适合部署的 Open Weights,准备 GPU 服务器,搭好 Environment,再把模型启动成内部模型服务。客服 Agent 随后通过公司内部网络调用这个 Local Model,处理用户问题和订单资料。

普通 Agent 用户需要本地部署吗

在社交平台上,经常能看到关于 AI 硬件采购的讨论。有些攻略会给人一种印象:想使用 AI,就得先买一台好几万块钱的高配 Mac,否则模型根本跑不起来。于是很多人还没开始学 AI,就开始迷糊,是不是必须得先买个这么贵的电脑才配玩 AI?

不是的。

这类推荐购买高配 Mac 的攻略,通常更接近开发人员 在自己的电脑上运行模型的需求,和新人用户 正常使用 Agent不是一回事。一定不要混淆。

因为 Apple 芯片采用统一内存,CPU 和 GPU 可以使用同一块内存,所以开发人员可以借助 Ollama、MLX 等软件,在 Mac 上运行一些较小的本地模型。这些工具,新人用户大多用不上。

你使用 Codex、WorkBuddy 时,操作门槛与普通软件相近。模型大多运行在厂商的云端服务器上,本机只负责执行操作。普通 Windows 电脑和低配 Mac 都可以使用,完全没有必要为了“使用 AI”专门购买一台高配 Mac。

当然,Codex 等 Agent 经常要通过终端运行命令,Windows 那套糟糕又混乱的终端环境,确实常常不如 Mac 顺手,使用时也更容易被一些终端问题“绊一下”。但这只是使用体验上的差异,是选择,不是门槛。

10. 一句话释义

  • Training 是开发人员让模型从大量示例中逐步形成能力的过程

  • Fine-tuning 是在已经训练好的模型上,用更贴近具体任务的数据继续训练

  • Parameter 是模型内部可以通过训练调整并保存的数字设置

  • Weight 是模型计算时与输入数字相乘、影响下一步计算的数值

  • Deployment 是把训练好的模型启动成可以接收请求的服务

  • Inference 是模型从收到一次输入到算出一次输出的过程

  • Local Model 是运行在个人或公司本地设备上的模型