AI绿皮书学习之路(一)-语言模型是什么

取自逻辑帧

一、ChatGPT的本质

1. ChatGPT 的本质是一个“超级函数”

  • 什么是函数: 就像中学数学里的 $y = f(x)$,输入一个 $x$,通过规则 $f$ 计算,得到输出 $y$

  • AI 也是函数: ChatGPT 的本质就是 $\text{回答} = \text{ChatGPT}(\text{问题})$。你输入问题,它通过极其复杂的数学规则进行计算,最后输出回答。

2. 1750 亿个参数就是“内燃机旋钮”

  • 参数是容器: 模型的“参数”就像是存储人类语言规律和世界知识的容器(比如记录“主语后跟动词”、“玻璃杯掉地上会碎”等常识)。

  • 庞大的控制面板: 拿 GPT-3 来说,它拥有 1750 亿个参数。你可以把它想象成一个拥有 1750 亿个微调旋钮的超级控制面板,每一个旋钮的组合和调节,都会决定最终输出的句子和语气

3. 语言的复杂性决定了它必须是“非线性的”

  • 为什么需要这么多参数? 因为人类语言极其复杂,包含一词多义、指代消解(弄清“它”指的是谁)、隐含常识和复杂的语气(如反讽)。

  • 为什么不能直接解方程算出参数?

    1. 计算量恐怖: 1750 亿个未知数的方程组,计算量大到宇宙中的原子都不够数。

    2. 它是非线性的: 语言不是简单的正比例关系(线性)。同一个词在不同语境下意思完全不同,这种“拐弯抹角”的复杂关系,必须通过模型内部多层嵌套的非线性系统(如激活函数 ReLU)才能表达。

总结: ChatGPT 不是靠神秘的“魔法”或真正的“人类意识”在思考,它是一个由 1750 亿个参数控制的、极其复杂的非线性数学函数,通过分布式组合的方式编码了人类的语言规律。

二、训练的本质

我们可以把整个训练过程拆解为以下几个通俗的核心概念:

1. 初始状态:一片混沌(随机初始化)

  • 大白话:刚出生的大模型是一个“小白”,体内的上千亿个参数都是一堆随机的乱码。

  • 表现:你问它“你好吗?”,它只会胡言乱语回复一堆无意义的符号(如 @#$%^&*)。

2. 核心循环:在错误中学习

模型变聪明靠的是一个不断重复数千亿次的循环,包含以下四个步骤:

  • 预测(试错):给模型前半句“今天天气”,让它猜下一个词。因为它现在还很笨,可能会高概率猜一个“苹果”(错误答案)。

  • 算账(Loss/损失):我们拿出正确答案“真好”和它的预测做对比。Loss(损失)就是一个衡量它“错得有多离谱”的数字。错得越狠,Loss 越大;训练的目标就是让 Loss 接近 0。

  • 追责(反向传播/Backpropagation):模型知道自己错了,但体内有 1750 亿个参数,是谁的责任?反向传播就像“扔飞镖偏左了”往回找原因一样,能精确计算出每个参数对这次错误该承担多大责任(这个责任值叫“梯度”)

  • 微调(梯度下降/Gradient Descent):既然找到了责任人,那就开始调整参数。公式会自动让参数往“能让错误变小”的方向挪动一点点。

3. 步伐的艺术:学习率(Learning Rate)

调整参数时,每次迈的步子有多大,由“学习率”决定:

  • 步子太大:会直接跳过最优解,导致模型训练崩溃。

  • 步子太小:像蜗牛爬,训练耗时太长,成本无法接受。

  • 聪明做法(动态衰减):初期在大山里,大步快跑(学习率大);接近山谷(最优解)时,小心翼翼迈小步(学习率变小),精细调整。

总结:

  • 训练的本质不是直接解出完美答案,而是通过海量数据不断“试错”并微调,最终无限逼近最优解。

  • 传统的计算机方法追求“精准导航”,必须完全理解规律并写出完美的数学公式。 而大模型的深度学习是一种“暴力美学”——我们不再教它什么是语言,而是把海量数据喂给它,让它在数千亿次的试错和微调中“自己悟出”规律。这就是量变引起质变(智能涌现)。

三、参数的演化

1. 参数的演化:从“死记硬背”到“理解规律”

  • 死记硬背(行不通): 如果让模型去死记硬背互联网上每一个“问题”和“答案”的组合,不仅参数根本装不下如此庞大的数据,而且遇到用户提问没见过的新句子时,模型就会直接傻眼。

  • 理解规律(真正的智能): 模型的参数实际上是在“寻找统计规律和语义关联”。比如看到成千上万次动物吃东西 text 后,参数会逐渐调整并稳定下来,固化出“动物与食物之间存在关联”的抽象知识。

  • 泛化能力: 因为掌握了规律,所以即使面对从未见过的新问题(比如“兔子吃什么”),模型也能根据规律推导并举一反三地回答出来。

2. 黑箱问题:没人知道每个参数具体代表什么

  • 分布式存储: 大模型(如早期的 GPT-3)拥有 1750 亿个参数。但这并不意味着“参数 A 记得猫,参数 B 记得鱼”。相反,“猫吃鱼”这个知识像全息图一样,是分散存储在成千上万个参数的组合之中的。

  • 不可解释性(黑箱): 这种组合极其复杂,导致人类目前无法精确追踪某一个特定参数的具体含义。这给 AI 带来了调试困难、安全性以及在医疗/法律等关键领域的信任度挑战。这与人类大脑中无数神经元共同协同产生一个想法的机制非常相似。

3. 模型架构的演进:Dense vs MoE

随着模型参数变成天文数字,如何平衡“变聪明”和“算得快、省电”成为了关键,于是演化出了两种架构:

  • Dense 架构(传统“老实人”): 每次回答问题,都会动用全部的参数进行计算(如 GPT-3)。虽然整体性强,但参数量大时,计算成本极高,回答变慢。

  • MoE 架构(混合专家模型): 内部塞了很多“专家子网络”,每次推理只激活其中的一部分参数。比如 DeepSeek-V4-Pro 有 1.6 万亿总参数,但每次处理只激活 490 亿参数。这让它能以极低的计算成本,获得接近万亿级大模型的能力。

总结: 大模型的参数不是用来“存标准答案”的,而是通过成千上万个参数的排列组合来“内化语言规律”的。训练完成后,这些参数就会被冻结(固定),它不会因为你当下的使用而实时变聪明,每一次回答都是基于已固化知识的计算结果。

四、大模型的文字接龙-贪吃蛇

1. 核心任务:预测下一个词

别看大模型好像什么都懂,它在后台做的事情其实纯粹得令人发指:根据你输入的话,不断预测接下来的“下一个词”是什么。 它并不是像人类一样先在脑子里写好整篇大纲,然后一下把整段话吐出来,而是一个词、一个词蹦出来的。

2. 工作机制:自回归(Autoregressive)

这就是“贪吃蛇”的核心。

  • 蛇每吃到一个食物,食物就会变成身体的一部分,蛇也因此变长。

  • AI 也是一样:它预测出第一个词后,会把这个新词和之前的所有内容拼在一起,变成新的“上下文”,然后再去预测再下一个词。这个“吐出新词 ➡️ 变成上下文 ➡️预测下下个词”的循环过程,在技术上就叫自回归

3. 计算本质:概率分布(Probability Distribution)

AI 是怎么挑出下一个词的呢?它不是靠猜,而是靠算概率

  • 每进行一步,AI 都会扫描自己的“大词表”(里面有几万甚至几十万个词)。

  • 拥有数千亿参数的模型会给词表里的每一个词算一个概率。比如输入“今天上海的天气”,AI 算出来接下来出现“怎么样”的概率是 45%,“很好”的概率是 30%……

  • 接着,AI 会根据这个概率列表进行采样(选择),挑出一个词(通常是概率最高的那个),然后继续接龙。

总结: ChatGPT 的本质不是在“思考”完美的答案,而是在玩一场精密的、基于概率计算的超级文字接龙游戏

五、概率分布的数学本质

1. 核心本质:概率分布(文字转盘)

大模型每说一个词,并不是靠“死记硬背”或者真正的“思考”,而是像天气预报一样计算概率

  • 什么是概率分布: 给定前面的话(如“今天天气真”),模型会给词表里的每一个词都算一个概率(比如:“好”是 60%,“不错”是 18%,“糟糕”是 5%)。

  • 全量计算: 哪怕词表里有 20 万个词,它每次也必须把这 20 万个词的概率全部算一遍,这就是为什么它需要极高的计算能力。

2. 核心流程:从文字到概率的 5 步走

大模型内部的计算就像是一个高度精密的加工厂:

  1. 文字变数字(Embedding / 词嵌入): 计算机看不懂中文,所以第一步是把每个词变成一串长长的数字(在 GPT-3 里是 12288 个数字),这串数字叫“向量”,里面包含了这个词的意思。

  2. 层层理解上下文(Transformer 架构): 这些数字会通过很多层(比如 96 层)的复杂数学计算。每一层都在分析词与词之间的关系(比如理解“天气”是名词、“真”是副词,组合起来是在描述天气)。

  3. 信息大融合: 算到最后一层时,最后一个词的数字串里,其实已经融合了前面所有字的全部含义。模型只用这最后一个融合了全局信息的数字串来预测未来。

  4. 算出原始得分(输出投影): 模型把这个数字串变换成匹配词表大小的“原始得分”。

  5. 得分变概率(Softmax): 原始得分有高有低,通过一个叫 Softmax 的数学公式,把它们标准化变成 0% 到 100% 之间、且加起来总和正好是 100% 的概率。

3. 生成机制:不是总选第一名(随机采样)

有了概率之后,模型并不是每次都死板地选择概率最高(那 60%)的那个词。

  • 它就像是在转一个“概率转盘”,面积越大的词(概率越高)越容易被指针指到,但面积小的词(概率低)也有微小的机会被选中。

  • 这种随机采样的机制,正是大模型具有“创造力”、且每次回答同样问题时内容可能不一样的秘密所在。

总结: 大模型是通过把文字转化为万维数字,经过上百层网络的数学计算,得出所有词的概率转盘,最后通过摇号(随机采样)的方式决定下一个吐出什么词。

六、简单任务背后的复杂智能

1. 核心机制:文字接龙(自回归)

大模型的本质其实就是一个“文字接龙”的函数。

  • 怎么接? 你给它一段话,它去预测下一个最可能出现的词。

  • 什么是“自回归”? 就像滚雪球。它每生成一个词,就会把这个新词加入到前面的盒子里,连同最初的问题一起,作为下一次预测的依据。它是一步一步、一个词一个词往下写的,而不是一瞬间写出整篇文章。

2. 深刻悖论:简单的任务,复杂的智能

既然只是“预测下一个词”这么简单的游戏,为什么大模型能表现得像人类一样聪明? 因为要把接龙玩到极致,模型必须在无形中掌握极其复杂的语言和世界规律

例子一:理解多义词

看这个句子:

"他拿起一只笔,笔______"

这个问题怎么填?

这个问题的难点在于:“笔”这个词有歧义。

  • 它可以是书写工具(笔尖、笔帽)

  • 也可以是抽象概念(笔迹、笔法)

如果模型理解成物理对象,可能会填"尖"、"帽"; 如果理解成写作行为,应该填"迹"、"触"。

因为前面提到“拿起”,这是一个物理动作。一个好的模型,应该给“尖”或“帽”更高的概率。

这说明:模型必须理解词的多义性,必须根据上下文消歧。

例子二:指代消解

再看这个:

"小明买了一部手机。它的屏幕______"

“它”指的是什么?小明?还是手机?

显然是手机。所以下一个词应该是"很大"、"很清晰",而不是"很聪明"(如果指小明)。

模型必须具备指代消解能力,才能预测准下一个词。

例子三:常识推理

"他把玻璃杯掉在地上,______碎了。"

什么碎了?玻璃杯,还是地板?

这需要常识:玻璃杯易碎,地板不易碎。所以预测的应该是“玻璃杯”碎了,而非“地板”碎了。

模型必须具备物理世界的常识,才能做出正确预测。

例子四:语用理解

"你能把窗户关上吗?我有点______。"

下一个词应该是什么?“冷”?“热”?“累”?

这需要理解:问"能不能关窗"通常暗示"感觉冷"或"觉得吵",而不太可能是"累"。

3. 自回归的致命缺陷:误差累积

这种“滚雪球”的生成方式有一个天然的缺点——走偏

  • 如果它在第1步稍微偏离了1度(选了一个不是最完美但还凑活的词),这个小偏差就会变成第2步的输入。

  • 到了第10步、第100步,误差就会像滚雪球一样无限放大。这就是为什么ChatGPT有时候聊着聊着就“写偏了”或者“胡言乱语(幻觉)”的原因。

总结: 大模型通过“预测下一个词”这一极简的规则,逼自己学会了人类的逻辑、常识和语境;但这种“走一步看一步”的机制,也让它容易因为前面的一句错话而彻底跑偏。

七、Token、幻觉与创造力

1. 什么是 Token?(AI 的“乐高积木”)

  • 人类语言的痛点:如果让AI直接预测下一个“词”,人类的词汇无穷无尽且每天都在造新词,AI根本记不过来,计算量也会撑爆。

  • Token 的妙用:AI把人类语言拆成了更基本、更小的单位——Token(词元)。这就像乐高积木,常用的词(如“今天”)是一整块积木,生僻词(如“ChatGPT”)则会被切碎成好几块小积木(“Chat”+“G”+“PT”)。

  • 核心结论:AI并不是在预测“词”,而是在预测“Token”。通过几万到几十万个固定的Token,AI就能像拼积木一样组合出世界上所有的词汇。大致来说,1个中文字大概等于1个Token

2. 为什么AI每次回答都不一样?(概率与“掷骰子”)

  • 不是死记硬背:AI在玩“文字接龙”预测下一个字时,并不会每次都死板地选择概率100%最高的那个字

  • 加入随机性:它会根据概率大小去“掷骰子”(随机抽样)。这样做的目的是为了让AI更像人类——人类表达同一个意思也会换不同的说法。这种随机性在“死板”和“混乱”之间找到了平衡,赋予了AI所谓的创造力

3. AI 其实是个数学“学渣”?(“背答案”与“请外援”)

  • 本质是“猜”不是“算”:当你问AI“23+47=?”时,它脑子里并没有列竖式计算,而是根据它看过的海量数据,“预测”出下一个词最可能是“70”。它就像一个把题库死记硬背下来的学生,一旦遇到没见过的题或让她数“单词里有几个字母”,很容易翻车。

  • 解决方案:为了不闹笑话,后来的AI学会了“请外援”(调用外部工具)。遇到算术题,它会在后台悄悄打开一个真正的计算器(Python代码)算好结果,再用人话回复你。虽然现在最新的AI逻辑推导能力变强了,但遇到复杂计算,依然需要依赖外部工具。

总结: ChatGPT的本质就是一个以 Token(词元) 为最小单位,在接龙过程中加入了一定随机性,并且学会了使用外部工具来弥补自身数学短板的“超级文字接龙游戏”。

八、什么是语言模型

1. 什么是“模型”?

现实世界极其复杂,人类为了方便理解和预测,会用简化的数学规律来描述复杂的现象,这就叫“模型”。

  • 就像物理模型能通过公式预测抛出小球的轨迹,气象模型能算出明天的降雨概率一样,语言模型就是用来“算”人类语言规律的数学工具。

2. 语言模型的本质:一场“概率猜词游戏”

人类说话看似复杂(涉及文化、情绪、历史),但在数学层面,它可以被看作是一个概率过程

  • 语言模型做的事情本质上就是“文字接龙”:根据已经说过的话(上下文),计算出下一个可能出现的词的概率分布。

  • 例如:写下“今天天气”四个字后,下一个词是“真好”的概率可能是 35%,是“糟糕”的概率是 8%,而是“紫色”的概率微乎其微。

  • 这个核心概念用数学公式表达就是 $P(w|C)$ (在给定上下文 $C$ 的条件下,某个词 $w$ 出现的概率)。

3. 模型为什么能猜得像“人话”?

模型之所以猜得准,是因为它把人类语言的三大规律“死死记住”,并转化成了概率:

  • 语法约束: 比如“天气”后面不能接颜色,所以接“紫色”的概率极低。

  • 语义常识: 比如现实中猫不会飞,所以“猫会__”后面接“飞”的概率远低于“爬树”。

  • 上下文关联: 同样是“它的__”,如果前文在聊“新手机”,接“屏幕”的概率就高;如果前文聊“做了一道菜”,接“味道”的概率就高。

4. 语言模型的“老祖宗”:香农游戏

这种“预测下一个词”的思路,并不是最近才发明的,早在 1948 年(比 ChatGPT 早 75 年)就被信息论之父克劳德·香农提出来了。

  • 香农游戏: 他曾让志愿者玩“猜下一个英文字母”的游戏,发现人类大脑其实也是在靠日常积累的语言统计规律来猜词。

  • ChatGPT 的前世今生: 今天的 ChatGPT 和 75 年前的香农游戏本质上完全一样。只不过当年是靠“人脑”一秒钟猜一个字母,而现在的 AI 是靠 1750 亿个参数,一秒钟猜 100 个词,最终实现了香农当年“制造写作机器”的神奇预言。

总结: 语言模型就是用数学概率来玩“文字接龙”的机器,它通过吃透人类的语法和常识,把“下一句该说什么”算得明明白白。

九、语言模型-从数据中学习规律

  • 抛弃了传统的“死记硬背”语法书(演绎法): 以前搞人工智能,语言学家和程序员要辛辛苦苦把几万条语法规则写进代码里。但人类语言太复杂了,规则永远跟不上变化(比如“绝绝子”、“emo”这种新词汇),所以老办法行不通。

  • 靠“海量阅读+疯狂统计”自学成才(归纳法): 现在的AI不学语法规则,它只做一件事——看无数的文章。它在看了几千亿个词之后发现:“我喜欢”后面跟着“吃”的次数有几百万次,而跟着“的”的次数几乎没有;“猫会”后面通常是“爬树”而不是“飞”。它通过这种概率统计,自己就把人类说话的套路给摸清了。

  • “大力出奇迹”: 这就是为什么现在的大模型都需要海量的数据和超大的计算能力。只要喂给它的数据足够多,模型足够大,那些原本极其复杂的语法、逻辑甚至世界知识,就会自动从数据里浮现出来。这种看似“笨重”的统计方法,反而战胜了以前精巧的人工规则设计。

总结:现在的AI就像一个超级聪明的婴儿,没人给它上语法课,但它通过日夜不停地听大人说话(看海量数据),自己总结出了怎么说话最像人类。

十、语言模型的演进

1. 第一代:N-gram 模型(1990s - 2000s)—— 拥有“金鱼脑”的统计员

  • 怎么工作:它是个纯靠“数数”的统计模型。比如看到“很”,它会去历史数据里查后面经常接什么词,“很好”出现得最多,它就预测下一个词是“好”。

  • 致命缺点记性极差。它最多只能瞅一眼前面 2~3 个词(窗口固定)。如果一句话长了一点(比如前面说了“下雨”,中间隔了十几个字,后面问水洼里有什么),它就完全转头忘了,根本联系不起来。

2. 第二代:RNN / LSTM 模型(2010s 早期)—— 玩“传话游戏”的记录员

  • 怎么工作:引入了“记忆机制”。AI 边读边在“小本本”上记要点,读到后面时,会结合前面的笔记一起理解。后来的 LSTM 还升级了“智能遗忘与筛选”功能。

  • 致命缺点信息容易糊涂。这就像玩“传话游戏”,话传到第 10 个人(第 10 个词)时,前面的细节就丢得差不多了(梯度消失/信息衰减)。它的极限也就是记住一两百个词,看长文章依然抓瞎。

3. 第三代:Transformer 模型(2017年至今)—— 开启“万人群聊”的掌控者

  • 怎么工作:这是颠覆性的技术革命!它彻底废除了排队传话的旧模式,发明了自注意力机制(Self-Attention)。它把看文章变成了“拉群聊”——所有的词同时进群,任何两个词之间都能瞬间直接对话,信息无损传递。

  • 核心优势

    • 眼神极好:处理最后的词时,它能直接“扫描”整句话,精准定位到前面最关键的信息(比如直接把“他”和几十个词前的“张三”连起来)。

    • 过目不忘:理论上可以处理无限长的文本。

    • 速度极快:所有的字可以同时处理(并行计算)。


总结 现在的 ChatGPT 等大模型之所以能陪你长篇大论、读懂整本书、甚至帮你写代码,就是因为它们基于 Transformer 架构,彻底解决了前两代模型“字数长了就健忘”的绝症。

十一、大语言模型与对话系统

1. 为什么AI模型要追求“大”?

  • 大力真的能出奇迹:这里的“大”指的是模型的参数量(可以理解为AI大脑里的脑细胞)和训练数据(喂给AI看的书本)非常庞大。现在的顶尖大模型(如GPT-4)参数量已经达到了万亿级别,它们“读”过的文字比人类几辈子看的还要多。

  • 涌现能力(突然开窍):AI并不是一点点变聪明的。科学家发现,当模型大到某个临界点时,它会突然“顿悟”,展现出前所未有的高级智能(比如复杂的逻辑推理能力),这就是必须把模型做“大”的原因。

2. 大模型 vs 小模型:未来是“大小搭配”

  • 大模型(如 GPT-4):像是个“通才教授”,极其聪明,能处理复杂的创作和推理,但运转成本极高,需要超级计算机,所以我们只能通过网络(云端)去调用它。

  • 小模型(如 ChatGLM-6B):像是个“专才助手”,体积小巧,甚至能在你的普通电脑或手机上直接运行。

  • 目前的趋势:小模型也在变得越来越精干(小而精)。未来的世界不全是大模型的天下,而是“大模型负责极其复杂的通用任务,小模型负责特定领域的日常任务”。

3. 最容易搞混的误区:语言模型 ≠ 聊天机器人

  • 纯粹的语言模型(比如纯 GPT-4 引擎):它的出厂设定只会玩“文字接龙”。如果你问它“如何学编程?”,它不知道你在提问,可能会根据网上的爆款文章给你续写成:“如何学编程?我也不知道,我从来没学过……”

  • 对话产品(比如 ChatGPT):它是 纯语言模型 + 额外的“聊天礼仪培训”。科学家在底层模型的基础上,专门教它理解什么是“提问”、什么是“回答”。经过这种专门的训练后,它才从一个只会文字接龙的“书呆子”,变成了一个懂规矩、能帮你条理清晰解决问题的“AI助手”。

总结: ChatGPT之所这么厉害,是因为它的底层有一个极其庞大、看了无数人类文章的“语言模型”作为智力支撑;而它之所以能像人一样和你一来一回地聊天,是因为它后期接受了专门的“对话训练”。

本文章仅供个人学习,如有侵权,请联系删除

评论