"训练"和"推理"是 AI 的两个阶段,核心一句话:训练是上学,通过练习把本事学进去;推理是上班干活,把学好的本事一遍遍用出来。新闻里说"训练某个大模型花了多少算力、多少钱",说的是前一阶段;你手机上问一句、它秒回,那是后一阶段。

拿学做菜来对照就清楚了。小王学厨,三个月里天天试做:盐放多了下次少放、火大了下次调小,前后练了上千次,才把几十道菜的手感练出来——这是"训练":这一轮集中练习,费时费钱。学成之后他开了家小饭馆,客人点什么他做什么,三五分钟上桌——这是"推理":天天发生,单次通常比完整学厨省事。注意一个关键细节:在这个类比里,我们把营业按菜谱做菜叫推理,把专门调整菜谱叫训练。真人厨师当然也能边做边学;模型通常不会只因回答了一次就自动更新参数。

AI可以借这个分工来理解,下面分开看。

一眼看懂 / 示意图

练菜谱,和照菜谱做菜

练菜谱,和照菜谱做菜训练:调整菜谱尝一尝 → 比差距 → 改一改推理:照菜谱做拿到要求 → 计算 → 给结果可以多轮练习通常不更新参数换资料 ≠ 重新训练
  1. 01训练

    练习、比较、调整参数

  2. 02推理

    用已有参数计算结果

常见模型工作方式;训练可多轮,推理成本依任务而变。

训练到底在"练"什么

一个大语言模型内部,有许多可调的小旋钮(行话叫"参数")。训练就是拿海量文字反复做三件事:

1. 先猜。给一段文字的上半句,让它猜下一个词是什么。 2. 对答案。拿它猜的和原文真实的下一个词比,算出差了多少。 3. 调旋钮。按差距调整需要更新的参数,往能减小误差的方向拧一点点,让它下次猜得准一些。

大规模预训练会让这三步反复循环,可能持续几周到几个月,动用大量计算设备。规模较小的模型、继续训练或微调,成本和时间又是另一回事——这就是新闻里"烧钱烧算力"说的那件事。练完之后,参数就被"冻"在了好用的位置,模型就算"毕业"了。

通常的推理:用已经学好的参数

训练结束、模型上线,你每次提问它回答,这个过程叫推理。推理有两个特点:

1. 参数冻结,纯算账。它不再做任何"调整",只是拿冻好的参数把你的问题算一遍、给出回答。单次推理通常远比完整训练便宜,但长回答、复杂推理或大模型仍可能耗时耗算力。当然,架不住每天上亿次的提问量,推理的总开销对厂商同样是天文数字——这是后话。

2. 版本更新 = 重新上学。你隔段时间听说"某某模型出了新版",可能是厂商拿新数据又训了一轮,也可能包含工具、检索或产品配置的更新(行话叫"继续训练"或"微调")。即使参数暂时不变,上下文、检索资料、工具和产品设置变化,也会影响回答。

聊着聊着,它会自己变聪明吗

不会,这是最容易误会的一点。你跟它聊一下午,它的参数一个都没变——它没有"越聊越懂你",更没有把你的话学进去。

它之所以"记得"你十分钟前说过什么,靠的不是学习,而是上下文窗口:把你俩这轮对话的文字临时摆在它眼前当参考资料,对话一关、窗口一清,它就全忘了(详见"上下文窗口"词条)。这也顺手解释了两个常见现象:

它的知识有"截止日期"。参数中的知识不会自动随新闻更新,因为训练早就结束了。要让它会新东西只有两条路:厂商拿新数据再训一轮,或者在回答时提供新资料,包括用户给的内容或工具检索回来的信息。

它不会"记住你这个人"。新开一个对话,它对你一无所知。有些产品提供"记忆"功能,那是把你的资料单独存在外面、每次对话再塞回上下文窗口里——仍然不是模型自己学会了什么。