1. 本章要说的概念
Training(训练)、Fine-tuning(微调)、Parameter / Weight(参数 / 权重)、Inference(推理运行)、Deployment(部署)和 Local Model(本地模型)。
2. 先分清:使用 AI 和开发 AI,是两种工作
你是不是也遇到过这种情况:本想学学怎样使用 Agent,找到一份很受欢迎的攻略阅读,却发现它一直在讲 Agent 的设计原理、运行结构、不同用户的权限、系统故障,以及怎样把整套服务部署上线。于是你很困惑,这些该不该学?
其实这类内容是面向开发人员的学习攻略,目标是帮助他们学会搭建和维护一套可以反复运行、供许多用户使用的 Agent 系统。
所以,如果说新人用户主要在使用 AI 应用或 Agent 软件,开发人员则可能在开发 AI 应用、搭建 Agent 或训练模型。
| 角色 | 主要目标 | 交付结果 | 角色任务 |
|---|---|---|---|
| 使用 AI 应用或 Agent 软件的用户 | 使用现成的 AI 应用或 Agent 完成自己的任务 | 报告、视频、邮件、分析结果等自己的工作成果 | 我用 WorkBuddy 办公,用 Seedance 生成视频、制作漫剧 |
| AI 应用或 Agent 开发人员 | 基于现成模型开发并维护 AI 应用或 Agent | 一套供用户或企业反复使用的 AI 应用或 Agent 产品 | 我把模型做成一套别人可以使用的 AI 应用或 Agent 产品 |
| 模型开发人员 | 训练、调整和优化模型本身 | 可以被各种 AI 应用或 Agent 系统调用的新模型或模型版本 | 我把模型训练好,它以后可以成为 Agent 的核心 |
对于新人用户来说,了解一些开发人员常说的核心概念,能帮助你理解不同 AI 应用和 Agent 软件的特点与现状。就像购买化妆品时了解一点工艺成分,买汽车时了解一点技术和结构,会帮助你更好地选择和使用这些商品。了解这些,并不意味着你要去做配方师或汽车开发人员;有些概念需要用上,有些需要记住,还有些知道大概意思就够了。
本章的概念,基本属于新人用户混个脸熟就够了的这一档。
3. 模拟任务:一套客服 Agent,是怎样从模型走到用户面前的
一家公司要做一套 To B 的客服 Agent:用户输入“付款后一直没有到账”,再附上一张订单截图,Agent 就需要看懂文字和图片,查询该公司的服务资料与订单状态,最后生成回复草稿。
在这套客服 Agent 系统中,模型开发人员需要提供能够处理文字和图片的模型;Agent 开发人员再把模型接入客服系统,连接企业服务资料和订单查询服务,加入回复要求、权限与验收机制。客服人员最后使用这套 Agent 系统,处理具体问题并确认回复。
4. 模型的类型:Foundation Model(基础模型)、LLM(大语言模型)、Multimodal Model(多模态模型)和 Reasoning Model(推理模型)
这四个名称会有重叠,并不是四个互不相干的品类。同一个模型可以同时属于其中几类。例如,GPT-5.6 Sol 既是大语言模型,也能读取图片,同时强调复杂推理能力。
Foundation Model(基础模型):是在大规模、多种资料上训练出来,可以继续适应许多任务的模型。GPT、Claude、Gemini 和通义千问等通用模型家族,都有可以作为基础模型使用的成员,例如 GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.6 Flash、Qwen3.5-Plus。开发人员可以在它们之上继续搭建聊天、写作、编程或客服 Agent。
Large Language Model / LLM(大语言模型):主要处理语言及相关任务,可以理解文字并生成内容。常见例子包括 GPT-5.6 Luna、Claude Haiku 4.5、DeepSeek V4 和 Qwen3.5-Plus。现在不少 LLM 还能读取图片,所以“大语言模型”不再必然等于“只能处理文字”。
Multimodal Model(多模态模型):可以处理不止一种信息形式。比如 GPT-5.6 系列、Claude Opus 5、Gemini 3.6 Flash 和 Kimi K2.5都可以同时处理文字和图片;有些多模态模型还会继续处理音频或视频。
Reasoning Model(推理模型):强调处理复杂问题和多步推理的能力。典型例子包括 GPT-5.6 Sol、DeepSeek-R1、Gemini 2.5 Pro 和 Claude Opus 5(开启 Extended Thinking 后)。这个名称更像对模型能力和定位的概括,不代表它与 LLM、多模态模型完全分家。
备注:不是每家公司都单独做一条“推理模型”产品线。像 Anthropic 就是把深度推理做成 Claude 主线模型(Sonnet、Opus 等)里可以开关的一种模式,也就是 Extended Thinking(扩展思考);开启后,同一个模型会花更多步骤逐步推理再给出答案。
5. Training(训练):模型的能力是怎样形成的
Training(训练)是开发人员让模型从大量示例中逐步形成能力的过程。模型在刚开始训练时,内部有大量尚未调好的数字设置。训练开始后,大致会反复发生四件事:
开发人员把文字、图片、代码等训练材料交给模型;
模型根据当前状态尝试预测或生成结果;
训练程序把模型的结果与正确内容进行比较;
如果结果有偏差,就把模型内部的大量数字分别调整一点,再进入下一轮。
这个过程会重复许多次。训练结束后,那些调整过的数字会随模型一起保存下来,模型也就形成了理解语言、识别图片或生成内容等能力。
Pre-training(预训练)是模型前期进行的大规模训练。这里的“预”是相对于后面的微调、强化学习等后续训练而言。预训练使用的材料范围通常很广,目的是先形成比较通用的语言、知识和图像处理能力,最后得到一个可以继续调整和使用的基础模型。
开发人员谈训练时,经常提到 Parameter(参数)和 Weight(权重)。它们不是两种互不相干的东西:
Parameter(参数):是模型内部所有可以通过训练调整并保存下来的数字设置。一个大模型可能有几十亿甚至更多参数。它们共同影响模型怎样处理输入、最后生成什么结果。
Weight(权重):模型会先把文字或图片转成数字,再一层层进行计算。计算时,每个输入数字都会乘上一个 Weight;Weight 较大,这个数字对下一步计算的影响就更强。大量 Weight 一起工作,模型才会逐渐识别词语、句子和图片之间的关系。
客服 Agent 的开发团队通常不会从头完成预训练,而是选择模型厂商已经训练好的成熟基础模型,再把它接入客服系统。
6. Fine-tuning(微调):在已有模型上继续训练
Fine-tuning(微调) 是在一个已经训练好的模型上,再用一批更贴近具体任务的数据继续训练。训练程序会反复把这些样本交给模型,并根据目标答案或人类评价调整模型参数。微调完成后,模型处理同类新问题时,会更倾向于采用训练数据中反复示范的最优做法。
SFT(Supervised Fine-tuning,监督微调):是直接用示范答案训练模型。例如,样本的一边写着“用户付款后一直没有到账”和当时的订单状态,另一边放入客服人员认可的回复。成千上万组这样的样本都在告诉模型:遇到这种输入,希望你这样回答。模型会逐步学会公司的表达方式、回复顺序和处理要求。
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习):则会让模型针对同一个问题生成多个回答,再请人比较哪一个更好。例如,一个回答信息准确但很生硬,一个回答解释清楚又符合公司的客服要求,另一个回答没有依据却擅自承诺退款。审核人员给这些回答排序,训练系统再把这种人的选择变成调整模型的依据,让模型以后更容易给出人们偏好的回答。
7. Deployment(部署)与 Inference(推理运行):从训练好的模型到一次客服回复
模型训练结束后,得到的是一套已经保存好参数的模型。还要为它准备计算设备和运行软件,把它启动成可以接收请求的模型服务,AI 应用或 Agent 系统才能调用。这个让模型进入可用状态的过程,叫 Deployment(部署)。
如果选择公司自主管理部署,公司需要取得允许自行部署的模型,常见选择是开放权重模型,再把它安装到自己控制的服务器上。服务器可以位于公司的机房,也可以是公司租用并自行管理的云服务器。公司还要准备足够的计算设备,安排开发和运维人员负责安装、更新、安全、权限及故障处理。这样做能让公司对运行环境和数据流向有更多控制,但硬件、人才和时间都是成本。
公司评估后发现,这套客服 Agent 需要尽快上线,业务对模型的要求也没有特殊到必须自行维护一整套运行系统,所以自主管理部署就显得有些太重了。于是,公司决定采购模型厂商托管的模型云端服务。模型厂商把模型部署在自己管理的云端服务器集群上,并提供调用地址、账号权限和接入说明。公司的开发人员把这些信息配置到客服系统中,客服 Agent 就能通过网络把用户问题送给云端模型,再取回处理结果。这样公司不用自己购买 GPU、安装模型和维护运行环境,可以更快上线。
客服 Agent 上线后,用户提交“付款后一直没有到账”和一张订单截图。客服 Agent 把需要理解的内容送给模型;模型读取文字和图片,计算并生成回复草稿,这个从“收到本次输入”到“算出本次输出”的过程,叫 Inference(推理运行)。
Temperature(温度) 是 Inference 时可以使用的一项设置,用来调节模型生成内容的变化程度。温度较低,回答通常更稳定、相似;温度较高,表达可能更多样。客服回复重视稳定和一致,往往会采用较低的温度。
8. Distillation(蒸馏)与 Quantization(量化):让模型运行得更轻
能力较强的大模型通常需要更多计算资源,处理大量请求时,速度和费用可能成为问题。开发人员常用 Distillation(蒸馏)和 Quantization(量化)让模型运行得更轻。
Distillation(蒸馏) 训练出一个新的小模型。开发人员先让较小的模型学习较大模型的输出和判断方式,再根据两者的差距不断调整小模型。较大的模型常被称为 Teacher Model(教师模型),学习它的小模型常被称为 Student Model(学生模型)。训练完成后,学生模型通常运行更快、占用资源更少,但能力可能不如教师模型完整。
Quantization(量化) 主要改变模型参数的保存和计算精度,让现有模型用更省空间的数字形式运行。例如,原来需要用 16 位数字保存的参数,可以改用 8 位或 4 位数字表示。参数数量可能没有减少,但每个参数占用的空间变小了,模型文件和运行时占用的内存随之减少,在合适的硬件上也可能运行得更快。精度压得越低,模型能力受到影响的可能性也会增加。
9. Local Model(本地模型)、Open Weights(开放权重)和 GPU(图形处理器):如果公司自己运行模型
把任务中公司的要求换一个条件:如果公司对信息和数据安全的要求极高,客服记录、订单信息和用户资料都要留在公司内部,包括客服 Agent 在内的所有模型服务也必须部署在本地。这意味着,公司只能进行自主管理部署,要在自己的机房和内部网络中把模型运行起来,并负责相应的计算设备、安装、更新、权限、安全和故障处理。此时,下面几个词就经常会一起出现:
Local Model(本地模型) 是运行在个人或公司本地设备上的模型。在这个任务里,它运行在公司的服务器上,客服 Agent 通过内部网络调用。
Open Weights(开放权重):模型训练时,会不断调整内部数以亿计的数字。训练完成后,这些数字被保存成文件;模型每次运行,都要读取它们。这些数字叫 Weight,保存它们的文件就是权重文件。Open Weights 表示模型厂商允许外部用户下载这些文件。公司取得权重文件后,就可以用自己的软件和服务器加载模型,让它在公司内部运行。
GPU(图形处理器) 是运行模型常用的计算设备。模型越大,需要的 GPU 数量、运行内存和计算能力通常越高。
企业本地部署:以完整版 DeepSeek-R1 为例,它有 6710 亿个参数,本地运行需要多张价格昂贵的服务器级 GPU。服务器、存储等硬件投入往往就会达到数百万元,再加上机房、电力、散热和维护,通常只有大型企业和机构才有这样的需求和投入能力。较小的蒸馏版或量化版模型需要的 GPU 会少很多,更适合中小型机构本地运行。这也是很多企业不会一上来就部署完整版大模型的原因。
模型和 GPU 准备好后,开发人员还要搭建 Environment(环境),也就是模型运行所需的操作系统、驱动、软件和配置。它和第八章的 Runtime 说的是同一类东西,只是站的位置不同:Environment 是开发人员搭建模型服务时准备的底层系统条件,Runtime 则是 Agent 实际执行一次任务时能用到的整套条件(往往就建立在这套 Environment 之上)。
为了方便安装、更新和迁移,还可能使用 Container(容器),把模型程序、相关软件和配置整理成一个可以重复部署的运行单元。
这样一来,整个过程就连起来了:公司取得适合部署的 Open Weights,准备 GPU 服务器,搭好 Environment,再把模型启动成内部模型服务。客服 Agent 随后通过公司内部网络调用这个 Local Model,处理用户问题和订单资料。
普通 Agent 用户需要本地部署吗
在社交平台上,经常能看到关于 AI 硬件采购的讨论。有些攻略会给人一种印象:想使用 AI,就得先买一台好几万块钱的高配 Mac,否则模型根本跑不起来。于是很多人还没开始学 AI,就开始迷糊,是不是必须得先买个这么贵的电脑才配玩 AI?
不是的。
这类推荐购买高配 Mac 的攻略,通常更接近开发人员 在自己的电脑上运行模型的需求,和新人用户 正常使用 Agent不是一回事。一定不要混淆。
因为 Apple 芯片采用统一内存,CPU 和 GPU 可以使用同一块内存,所以开发人员可以借助 Ollama、MLX 等软件,在 Mac 上运行一些较小的本地模型。这些工具,新人用户大多用不上。
你使用 Codex、WorkBuddy 时,操作门槛与普通软件相近。模型大多运行在厂商的云端服务器上,本机只负责执行操作。普通 Windows 电脑和低配 Mac 都可以使用,完全没有必要为了“使用 AI”专门购买一台高配 Mac。
当然,Codex 等 Agent 经常要通过终端运行命令,Windows 那套糟糕又混乱的终端环境,确实常常不如 Mac 顺手,使用时也更容易被一些终端问题“绊一下”。但这只是使用体验上的差异,是选择,不是门槛。
10. 一句话释义
Training 是开发人员让模型从大量示例中逐步形成能力的过程
Fine-tuning 是在已经训练好的模型上,用更贴近具体任务的数据继续训练
Parameter 是模型内部可以通过训练调整并保存的数字设置
Weight 是模型计算时与输入数字相乘、影响下一步计算的数值
Deployment 是把训练好的模型启动成可以接收请求的服务
Inference 是模型从收到一次输入到算出一次输出的过程
Local Model 是运行在个人或公司本地设备上的模型