了解什么是大语言模型(LLM)、它是如何被训练的,以及它为什么看起来无所不知。
在 Kodokon 中打开本课你多半已经听说过 ChatGPT、Claude 或 Gemini。它们都是生成式 AI:一种能够根据文字请求生成全新文本(一段解释、一份摘要、一首诗、一段代码)的计算机程序。藏在它们背后的引擎叫做 LLM,即 *Large Language Model*(大语言模型)的缩写。在计算机领域,“模型”是一种从示例中学到规律的程序,而不是由人一条一条写好规则去执行的程序。
它的基本原理其实简单得出人意料:LLM 是一台预测文本如何续写的机器。当你读到“猫正睡在……上”时,你的大脑会自然而然地补上“沙发”或“床”。LLM 做的正是这件事,只是规模极其庞大:每一步,它都会计算哪个词(或词的一部分)最有可能接下来出现,把它加上,然后重新开始。因此,一整段回答无非就是一长串接连不断、一个词一个词的预测。这和你手机键盘上的候选词提示是同一套机制,只不过强大得无法相提并论。
你是一位耐心的老师,向一个完全的新手讲解计算机知识。
请像我 12 岁一样,向我解释什么是大语言模型(LLM),不要出现任何未加说明的技术术语。
约束:
- 使用一个日常生活中的类比。
- 最多 10 句话。
- 结尾提出一个问题,用来检验我是否听懂了。这台机器是怎么学会如此出色地预测的呢?靠训练:这是一个(在你的第一次对话之前就完成的)阶段,在此期间模型会“阅读”海量文本——书籍、文章、网站、计算机代码。对于每一句话,它的后续内容会被遮住,然后要求模型去猜。当它猜错时,它的参数就会被微微调整——也就是它内部那数十亿个极其微小的设置。把这个过程重复数十亿次,模型最终就掌握了语法、文风,以及训练文本中蕴含的大量知识。
这正是生成式 AI 看起来无所不知的原因:它“读过”的藏书量,超过一个人活上一千辈子都读不完。但请留意这个词:*看起来*。模型在回答时并不会去查阅一本百科全书,它也不像你那样“理解”。它是根据训练结果,计算出最合乎情理的词语序列。大多数时候,合乎情理=正确。但并非总是如此,而这恰恰是下一课的主题。
我刚学到:LLM 通过预测文本来工作,它们是在海量语料上训练出来的,而且它们只会生成最合乎情理的续写。
请向我提出 3 个问题,每次只问一个,用来检验我是否真的理解了这三点。
每问一个问题后,等我作答,然后善意地纠正我,再问下一个。
在我尝试之前,绝不要把答案告诉我。