Kodokon kodokon.com

什么是生成式 AI?

了解什么是大语言模型(LLM)、它是如何被训练的,以及它为什么看起来无所不知。

6 分钟 · 3 题

在 Kodokon 中打开本课

你多半已经听说过 ChatGPT、Claude 或 Gemini。它们都是生成式 AI:一种能够根据文字请求生成全新文本(一段解释、一份摘要、一首诗、一段代码)的计算机程序。藏在它们背后的引擎叫做 LLM,即 *Large Language Model*(大语言模型)的缩写。在计算机领域,“模型”是一种从示例中学到规律的程序,而不是由人一条一条写好规则去执行的程序。

它的基本原理其实简单得出人意料:LLM 是一台预测文本如何续写的机器。当你读到“猫正睡在……上”时,你的大脑会自然而然地补上“沙发”或“床”。LLM 做的正是这件事,只是规模极其庞大:每一步,它都会计算哪个词(或词的一部分)最有可能接下来出现,把它加上,然后重新开始。因此,一整段回答无非就是一长串接连不断、一个词一个词的预测。这和你手机键盘上的候选词提示是同一套机制,只不过强大得无法相提并论。

PROMPT
你是一位耐心的老师,向一个完全的新手讲解计算机知识。

请像我 12 岁一样,向我解释什么是大语言模型(LLM),不要出现任何未加说明的技术术语。

约束:
- 使用一个日常生活中的类比。
- 最多 10 句话。
- 结尾提出一个问题,用来检验我是否听懂了。
一段可直接复制的提示词:按你自己的水平把 LLM 讲清楚。

这台机器是怎么学会如此出色地预测的呢?靠训练:这是一个(在你的第一次对话之前就完成的)阶段,在此期间模型会“阅读”海量文本——书籍、文章、网站、计算机代码。对于每一句话,它的后续内容会被遮住,然后要求模型去猜。当它猜错时,它的参数就会被微微调整——也就是它内部那数十亿个极其微小的设置。把这个过程重复数十亿次,模型最终就掌握了语法、文风,以及训练文本中蕴含的大量知识。

这正是生成式 AI 看起来无所不知的原因:它“读过”的藏书量,超过一个人活上一千辈子都读不完。但请留意这个词:*看起来*。模型在回答时并不会去查阅一本百科全书,它也不像你那样“理解”。它是根据训练结果,计算出最合乎情理的词语序列。大多数时候,合乎情理=正确。但并非总是如此,而这恰恰是下一课的主题。

PROMPT
我刚学到:LLM 通过预测文本来工作,它们是在海量语料上训练出来的,而且它们只会生成最合乎情理的续写。

请向我提出 3 个问题,每次只问一个,用来检验我是否真的理解了这三点。
每问一个问题后,等我作答,然后善意地纠正我,再问下一个。
在我尝试之前,绝不要把答案告诉我。
养成好习惯:让 AI 来考你,而不是被动地反复重读。

知识检测

确认你已牢记本课的重点内容。

  1. 从根本上说,一个大语言模型(LLM)在写回答时做的是什么?
    • 它实时复制在互联网上找到的段落
    • 它一个词接一个词地预测文本最合乎情理的续写
    • 它套用工程师一条一条写好的语法规则
  2. LLM 的训练指的是什么?
    • 人类把它所有可能的回答都写出来的那个阶段
    • 在对话中由用户教它东西的那个时刻
    • 模型通过猜测海量文本如何续写来调整自身参数的那个阶段
    • 把软件安装到服务器上
  3. 为什么生成式 AI 会给人一种无所不知的感觉?
    • 因为它在回答前会到百科全书里核对每一句陈述
    • 因为它是在覆盖几乎所有主题的海量文本上训练出来的
    • 因为它永久连接着人类专家