大语言模型,说白了就是一个“超级能接话”的程序:它读过海量文字,练出了一身“根据上文猜下一个词”的本事。你输入一句话,它一个词一个词地接着往下写,写出来的东西通顺、扣题,看起来就像在跟你对话、替你干活。
先看一件它具体能做的事。你给它一段原文:“周五下午三点,二楼会议室开会,请带上方案。”再交代一句“改成给同事看的简短提醒”。它得做两件事:一是保住原文里的硬信息——周五、下午三点、二楼会议室、带方案;二是把语气改得随意些。结果可能写成:“周五15点,二楼会议室见,记得带方案。”注意,这句话多半不是从哪篇网页上整句抄来的,而是它根据你的要求现场组织出来的——这正是它和搜索引擎不一样的地方:搜索是找现成答案,它是按任务重新组织文字。
通知可以换说法,原文事实要留下
- 01可以改写
“下午三点”→“15点”;周五、二楼、带方案都保留
- 02不能凭空补
原文没有“五点散会”,也没有“三楼”
模型按任务组织文字,不代表它生成的每一个细节都有依据。
核心就三句话
1. 它干的事,本质是“接着上文往下写”。 你输入的文字会先被切成一个个小段(行话叫 token,大致相当于字或词片),模型再根据前面所有内容,算出下一个最可能的小段,一个接一个往外蹦。聊天、写邮件、改稿子,全都是这一个动作的不同包装。
2. 它的“知识”来自海量文字里的规律,不是一本查好的档案。 训练时它读了巨量的书、网页、对话,记住了“什么样的词通常跟着什么样的词”,顺带把很多事实、写法和推理套路也压进了这些规律里。所以它能答很多题,但它并不是在脑子里翻一本核对过的百科全书。
3. 说得顺,不等于说得对。 它练的是“写得像人话”,不是“每句都可查证”。通顺、自信、格式工整,都不能当作事实本身的担保。这一条下面专门展开。
它是怎么练出来的
可以把它想象成一个读完了整座图书馆的写作者:各种题材、各种口吻都见过,你给个开头,它就能模仿得惟妙惟肖。这个类比帮你理解“为什么它什么都能聊两句”,但别当真——它没有人的经历,没有亲眼见过任何事,也没有自己的想法,它只是把文字里的统计规律学到了家。
真实机制分两步。第一步叫预训练:让它在海量文本上反复做“遮住后半截、猜下一个词”的练习,做错了就微调内部参数,做对了就巩固——几十亿、几万亿次练下来,语言规律和世界知识就一起被压进了模型。第二步是后续训练:再用“指令—好回答”的样例和人对回答的打分继续调教,让它从“会接话”变成“会听指令、答得有用”。
为什么会一本正经地编错话
还是刚才那张通知。如果原文没写几点散会,模型却补一句“五点散会”,问题就大了——它不是在查日程,而是觉得“补个散会时间更像一条完整通知”。这类现象有个专门称呼,叫 AI 幻觉:模型可能编出不存在的书名、张冠李戴的数字,或者把两件相似的事拼成一件,而且语气照样理直气壮。
原因就在上面第二条:它的目标是把话写得“像”,而不是逐条核对来源。所以实用的用法是——让它干它擅长的:解释、草拟、改写、理思路;而它给出的关键事实(时间、法规、数字、专业结论),自己动手查一遍原始来源再采用。
你用的聊天软件,不等于模型本身
平时你打交道的是一个“产品”,模型只是产品的发动机。产品常常在模型外面再接搜索、计算器、文档等工具:比如你的问题里提到“昨天的新闻”,它答得有鼻子有眼,很可能是产品先替它上网搜了材料、再交给它参考着写,而不是模型自己连夜学会了新消息。
还有两个容易想岔的点:一是“预测下一个词”描述的是主流聊天模型的基本动作,但它概括不了模型全部的本事;二是你跟它聊再多,也只是在这一次对话里提供上下文,模型本身的参数并不会因为你聊过就悄悄更新——它不会“记住你”,除非产品专门做了记忆功能。