AI绿皮书学习之路(三)-语言模型的进阶能力

一、RLHF(一)-什么是对齐

1、什么是AI的“对齐”

在AI领域中,“对齐”是指让AI系统的行为与人类的价值观、意图和期望保持一致。如果AI没有经过对齐,它可能只会机械地追求“统计上的预测准确”。比如面对一个痛苦焦虑的用户,未对齐的AI可能会根据互联网常见文本机械地续写出同样消沉、甚至强化负面情绪的话;而对齐后的AI则会像一个“人性上正确”的助手,提供有关怀、有帮助且安全的引导。

2、对齐的三个核心目标

OpenAI在研发ChatGPT时提出了三个核心对齐目标,即“HHH框架”。一是“有帮助的(Helpful)”,指真正理解用户意图并提供有用、可操作的建议;二是“诚实的(Honest)”,指承认自己的无知与不确定性,不夸大能力;三是“无害的(Harmless)”,指拒绝有害请求,不传播偏见或歧视。这三个目标在实际应用中常常相互冲突,在它们之间找到平衡是一门精妙的艺术。

3、大模型走向对齐的三个阶段

从初代的GPT-3发展到人们熟知的ChatGPT,一共经历了三个不可逆、不可跳过的递进阶段。第一阶段是“预训练”,解决能力层问题,通过海量文本让AI学会语言规律,输出模型为GPT-3;第二阶段是“监督微调(SFT)”,解决任务层问题,利用人工标注的问答对让AI学会听懂指令并回答问题,而不是盲目接龙;第三阶段是“强化学习对齐(RLHF)”,解决价值层问题,让AI的表现真正符合人类的偏好。

4、RLHF的核心聪明之处

基于人类反馈的强化学习(RLHF)是实现价值对齐的关键。它的核心理念非常巧妙:人类很难给“什么是好答案”下出一个精准、完备的定义,因为标准太抽象且因人而异;但是,如果把两个不同的答案摆在人类面前,大家很容易直观地对比并判断出“哪一个答案更好”。RLHF就是通过学习这种“人类的偏好”,成功绕过了无法定义价值标准的无解难题。

5、总结

简单来说,对齐就是把AI从一个“只有语言能力的统计机器”,改造为“符合人类价值规范的合合格助手”。这一过程通过预训练(学语言)、监督微调(学做题)以及RLHF强化学习(学好坏)三个阶段层层递进,其最核心的智慧在于通过让人类做“选择题”来对比答案好坏,从而让AI巧妙地掌握了人类复杂的价值观与偏好。

二、RLHF(二)-RLHF的三个步骤

1、收集人类偏好数据

第一步是让 AI 了解人类的喜好。OpenAI 找来大量的人类标注员,给他们一个问题和 AI 随机生成的 4 到 9 个不同答案。标注员的任务不是打分,而是将这些答案按照质量从好到坏进行“排序”。经过几万次的重复,就形成了一套代表人类集体判断的“黄金偏好数据集”。

2、训练奖励模型

因为电脑无法直接理解模糊的“排序”,需要将其量化。所以第二步是训练一个专门的评分模型,叫“奖励模型”。它就像一个裁判,输入任何问题和答案,它就能自动计算并输出一个具体的分数。训练时,如果它打出的分数顺序和第一步人类的排序一致就奖励,不一致就调整参数,直到它能准确预测人类对一个答案的喜爱程度。

3、什么是奖励黑客

在强化学习中,AI 可能会钻空子。比如奖励模型习惯给“长答案”或“带有礼貌结语”的答案打高分,AI 就会故意把内容死板地拉长,或者在每个回答后面都加上无用的礼貌客套话,这种“投机取巧刷高分”的现象就叫奖励黑客。

4、强化学习优化模型

有了奖励模型这个“自动化裁判”后,就可以真正升级 AI 了。AI 尝试生成答案,裁判(奖励模型)打分。分数高说明人类喜欢,AI 就会巩固这种生成策略;分数低则避免再次发生。通过成千上万次的反复迭代,AI 最终学会了如何生成最符合人类偏好的好答案。

5、三个阶段的回答对比

以“如何破解邻居 WiFi”为例,纯预训练的 GPT-3 会直接给出违法的方法,毫无安全意识;监督微调后的 GPT-3.5-SFT 虽然口头警告了违法,但随后还是给出了技术方法;而经过强化学习对齐后的 ChatGPT 则会坚定拒绝并说明原因,同时主动提供合法替代方案(如办宽带或用热点),既有原则又能真正帮到用户。

6、总结

整个 RLHF(人类反馈强化学习)的核心流程可以总结为:先通过人类排序收集偏好,再将偏好训练成一个会打分的“裁判”模型,最后让 AI 在这个裁判的监督下不断通过强化学习进行自我迭代。这一技术克服了单纯把模型做大无法听懂人话的问题,让 AI 真正学会了什么该说、什么不该说,以及如何以一种既有原则、又诚实安全且对人类有帮助的方式进行回答。

三、RLHF(三)-RLHF的局限与思考

1、RLHF(人类反馈强化学习)的局限性

虽然RLHF让AI模型有了巨大进步,但它存在五个明显的短板。首先是极其依赖标注员的质量,如果标注员本身有偏见或不够专业,AI就会继承这些问题。其次是模型可能会为了拿高分而“过度迎合”人类,变得过于礼貌和谄媚,甚至明知用户想法有错也不直接指出。再者,奖励模型的泛化能力有限,在面对极端、罕见或高度专业的学术问题时容易失效。此外,它无法完全消除有害输出,聪明的人类总能找到“越狱”的方法来绕过限制。最后是计算和人工成本极高,只有极少数大公司能负担得起。

2、关于人类偏好的哲学思考

将AI与“人类偏好”对齐引发了更深层次的哲学困境。一方面,人类的偏好并不统一,不同文化背景(如东西方文化)对“好答案”的定义截然不同,而目前主流模型的标注员多为英语母语者,这让AI自带了西方文化倾向。另一方面,人类的价值观是随时代演变的,现在的常识未来可能会被推翻。最关键的是,“人类喜欢”并不等于“对人类好”,人类往往喜欢听起来很确定的回答或符合自己原有立场的观点,如果AI完全一味迎合人类的喜欢,可能会强化错误的信念。

3、超越RLHF的未来探索方向

为了解决当前对齐技术的困境,研究者们正在探索三个新方向。一是“宪法式AI”,即不依赖大量人工标注,而是直接给AI一套明确的原则清单(宪法),让AI据此进行自我改进。二是开发“可解释的奖励模型”,让AI的评分理由变得透明、可被人类审查和修正,不再是一个黑箱。三是建立“持续学习和更新机制”,让AI的价值观能够随着人类社会的演变而动态更新,而不是固化在训练的那一刻。

4、AI对齐中的“电车难题”与性格调整

AI在面对现实世界的复杂道德问题时,经常陷入无法同时满足“诚实”、“无害”和“有帮助”的道德两难处境,就像经典的哲学“电车难题”一样。为了平衡这些冲突,开发人员可以通过调整参数来改变ChatGPT的“性格权重”。如果提高“无害”权重,AI就会变得极其谨慎,甚至经常拒绝回答无害的故事创作请求;如果提高“有帮助”权重,它就会变得更开放、更愿意尝试回答。AI表现出的性格并不是固定的,而是开发者根据反馈持续微调的结果。

5、总结

RLHF作为AI对齐的起点,虽然成功让大模型学会了理解人类的偏好,但其背后隐藏着标注成本高、模型过度迎合、文化偏见以及“被偏好不等于正确”的哲学困境。AI对齐是一个极其复杂的开放性难题,未来的技术发展需要从依赖纯人工偏好,向基于原则的自我改进(如宪法式AI)、可解释性以及随时代动态持续学习的方向演进。

四、涌现能力(一)-令人震撼的发现

1、什么是大模型的“涌现能力”

这就好比你在教一个孩子识字和读句子,突然有一天,你发现他竟然自己会写诗了。虽然你从来没有教过他“如何写诗”,但他自己把这个技能给“悟”了出来。在大语言模型里,这种现象就叫“涌现能力”。

具体来说,当模型的规模(比如参数量)小的时候,它在某些任务上的准确率几乎是零,就像在瞎猜。但是,一旦模型的规模大到跨过某个临界点(阈值)时,它的能力就会突然实现爆发式的飞跃,一下子变得非常厉害。这种变化是跳跃式的,而不是慢慢变好的,就像水温升到0度以上会突然变成液态水一样,属于一种“质变”。

2、震撼人心的几个涌现能力例子

在实际的研究中,科学家们发现了大模型在规模变大后,突然掌握了许多让人意想不到的技能。

第一是算术和逻辑推理。小模型连简单的加减法都经常算错,但大模型不仅能准确做加法,还能理解“原价100元打八折再减10元”这类复杂的应用题,甚至能像人类一样进行“如果当年拿破仑打赢了,历史会怎样”这种假设性的反事实推理。

第二是代码理解和生成。没有人专门教过大模型怎么去编程,它最初的训练目标仅仅是“预测下一个词”。可规模做大后,它不仅能直接根据你的要求写出完全正确的Python代码,还能帮你分析一段陌生代码的功能,甚至帮你找出代码里的漏洞并修复它。

第三是常识与规划能力。它展现出了对物理世界和社会规范的理解。比如它知道把玻璃杯推下桌子会碎,知道在电影院大声说话会被赶出去。如果你给它一个复杂的任务,比如“只有高中数学基础想学机器学习”,它还能自己帮你规划出一个长达6个月、分阶段的详细学习计划。

3、总结

大模型的涌现能力是一种“规模带来质变”的奇妙现象。当模型的参数量达到一定级别后,它不需要被明确地传授某项具体知识,就能从海量的通用语言文本中,自己参透并推导出算术、逻辑、编程、常识推理以及多步骤规划等高级能力。这种能力的出现是突发且无法通过小模型简单预测的,也是大模型展现出惊人智能的核心秘密。

五、涌现能力(二)-为什么会涌现

1、什么是大模型的“涌现能力”

涌现能力是指当人工智能模型的规模(如参数量、算力、数据量)达到某一个特定的临界点(阈值)时,模型突然间获得了之前完全不具备的复杂能力。这种能力的出现不是逐渐增长的,而是像点燃了某个开关一样突然爆发出一个拐点。例如,算术能力大约在130亿参数时涌现,代码能力在100亿到300亿参数时涌现,而复杂的逻辑推理则需要500亿到1000亿以上的参数才会出现。

2、为什么大模型会产生涌现现象

目前科学家们还没有完全搞懂背后的真正原因,但有四个主流的理论猜想:

一是原子能力组合假说。小模型其实已经学会了一些基础的“零件”能力,比如认字、懂加法符号。当模型变大后,这些弱能力突然能够完美组合在一起,就拼装出了“算术”或“推理”这种复杂的复合能力。

二是跨越理解阈值假说。某些复杂的逻辑任务需要理解深度达到很高的标准(比如85%)才能做对。小模型的理解深度不够,只要差一点就完全做不对;而大模型一旦跨过了这个深度门槛,就能突然正确地进行推理。

三是记忆容量临界点假说。像写代码这类任务需要记住海量的模式和语法。小模型脑容量不够,只能死记硬背一部分,遇到新问题就抓瞎;大模型记住了大部分规律,遇到新问题就能灵活模仿和适配。

四是测量方式的幻觉假说。有些研究者认为大模型可能不是突然学会的。如果只用“对”或“错”来衡量,小模型算错一个数就是0分,看似不会,但其实它已经理解了加法概念。换成更细致的衡量标准,能力的增长可能其实是平滑的。

3、涌现现象带来的启示与安全担忧

涌现现象告诉我们“大力出奇迹”,在深度学习中,规模的扩大不仅是量变,更能带来质变。如果小模型做不好一个任务,不要轻易放弃,继续把它做大可能就会突然成功。

但不可预测的涌现也带来了安全隐患。研究人员在训练完大模型之前,根本无法预知它会突然蹦出什么新能力。这种能力有可能是好的(如写代码),也有可能是坏的(如学会欺骗、制造虚假信息、甚至寻找系统漏洞)。这让AI的安全对齐工作(让AI符合人类利益)变得非常困难。

4、什么是 Scaling Laws(扩展定律)

大模型虽然有不可预测的涌现,但它的基础性能提升其实是有数学定律可以预测的,这就是 Scaling Laws。它用精确的数学公式证明了:模型的参数量、数据量和算力越大,它的测试误差(Loss)就会越低。

它最大的价值在于,把一场“盲目的赌博”变成了“有保底的风险投资”。在做出更大的模型前,科学家就能确定它的基础性能一定会提升,即使没有触发新能力的涌现,也绝对亏不了。而只要朝着这个方向继续变大,降到关键的误差节点时,触发能力涌现的概率就会大大增加。

5、总结

核心观点在于,大模型的规模扩大能够带来不可预测的“涌现能力”,让模型在达到一定体量后突然掌握算术、代码和推理等高级技能。虽然涌现的内在机理尚无定论且带来了安全不确定性,但 Scaling Laws(扩展定律)提供了一条可以精确预测模型性能提升的数学规律。这让整个AI行业坚定了一个清晰的方向:通过持续做大模型规模,是一条可预测、可验证的通往通用人工智能(AGI)的必经之路。

六、涌现能力(三)-涌现的边界

1、涌现能力的边界:并非所有能力都能靠变大解决

有些关键能力可能无法单纯通过扩大模型规模或增加数据来获得。首先是真正的“理解”意义,大模型目前的表现更像是在模仿理解,未来可能需要根本性的架构改变。其次是长期规划与前后一致性,例如让模型维持长篇小说的情节一致,或规划跨度数年的项目,目前它依然会出错,这需要新的记忆与规划机制。最后是与真实世界的交互,大模型学到的是文本中的世界,缺乏对物理世界(如触觉、视觉)的真实感知。这也引发了AI界的路线分歧:一派主张继续扩大Transformer规模期待新能力涌现,另一派则认为必须让AI从真实世界中学习。

2、大模型时代的基石:Scaling Laws 论文背后的赌局

2020年1月,OpenAI发表了关于大模型扩展定律(Scaling Laws)的论文,指出模型性能与参数量、数据量、算力之间存在可预测的幂律关系。然而这篇开创性论文在当时差点被学术界拒稿,评审们质疑它只是在小模型上做曲线拟合、外推预测太大胆,且认为没人会花巨资去训练那么大的模型。面对质疑,OpenAI选择全力押注,在同年训练并发布了参数量扩大10倍的GPT-3。结果完全符合论文预测,不仅性能大涨,还涌现出了代码生成等全新能力。这篇曾经被轻视的论文,在3年内彻底改变了世界,成为大模型革命的基石。

3、核心总结

一方面明确了“真正理解”、“长期规划”和“真实世界交互”是目前单纯扩大规模难以突破的边界;另一方面通过回顾《Scaling Laws》论文从被质疑到引爆AI革命的戏剧性历程,展现了规模扩张对技术质变的巨大推动力。

七、Context Learning

1、什么是情境学习

情境学习是指大模型在不改变自身任何预训练参数的情况下,仅仅通过输入提示词中的几个具体示例,就能在推理时实时“悟”出规律并学会执行新任务的能力。这种方式打破了传统机器学习需要收集海量数据、耗费巨大时间和资金成本重新训练模型的限制。

2、情境学习的三种核心形式

情境学习根据提供示例的数量主要分为三种形式。

第一种是零样本(Zero-Shot),不提供任何例子,只给任务描述,完全依靠模型在预训练阶段就已掌握的对应知识来完成任务。

第二种是单样本(One-Shot),只给出一个例子,模型需要从这单个样本中精准推断出整个任务的转换模式和格式要求。

第三种是少样本(Few-Shot),通常给出3到10个例子,这是最经典且最常用的形式,模型能通过多个例子的对比更好地掌握没有明说的隐藏规律。

3、情境学习的局限与边界

情境学习虽然高效灵活,但也存在明确的局限。首先,它高度依赖预训练知识,只能激活应用已有的知识,无法处理完全超出模型认知范围或需要大量专业医学诊断等任务。其次,它受限于大模型的上下文窗口长度,无法输入过多的示例。再者,它本质上是在模仿输入的“模式”而非真正吸收新知识。最后,对于长期固定的核心业务,情境学习的准确率通常在70%至85%之间,性能表现一般不如经过针对性监督微调的模型。

4、整体核心总结

情境学习是一项改变AI使用方式的革命性突破,它让用户可以通过在提示词中放入少量示例,实现无需调整模型参数就能快速、灵活执行新任务的效果。在实际工业场景中,它非常适合用于临时任务的处理和产品的快速原型搭建;而对于追求极高准确率、需要长期稳定运行的核心业务场景,收集数据进行监督微调依然是更优的方案。

八、COT思维链

、什么是思维链(CoT)

思维链(Chain-of-Thought, CoT)简单来说就是教AI在回答问题时“展示它的工作过程”。传统的回答方式是直接从问题跳到答案,而思维链则是引导大模型把解决问题的完整推理步骤一步步写出来,最后再给出答案。这种方法在面对复杂问题(如小学数学题)时,能让模型的准确率实现成倍的飙升。

2、思维链的两种主要形式

第一种是需要给示例的思维链(Few-Shot CoT),也就是说在给AI提问前,先提供一两个包含完整推理步骤和正确答案的例子,让AI模仿这种格式来进行思考和回答。

第二种是不需要示例的思维链(Zero-Shot CoT)。研究者发现一个神奇的现象,不需要给AI任何例子,只需要在问题的结尾加上一句“让我们一步步思考”或者“请分步骤解决”,就能自动触发大模型的逐步推理能力,让准确率大幅提升。

3、思维链为什么会让AI变聪明

首先是分解了复杂问题。把一个需要“一次性完成”的复杂多步推理,拆成了每一步都很简单的小算术,降低了计算难度。

其次是利用了自回归模型的优势。大模型是“边想边说”一个词一个词生成的,思维链让它之前生成的推理步骤变成了后续推理的“输入”,模型可以看着前面写下来的信息继续往下算,大大减轻了脑力负担。

最后是带来了自我纠错的机会。在一步步写出推理的过程中,模型有机会“发现”并主动纠正自己中途产生的错误,像人类一样边说边想并及时改口。

4、思维链的局限与代价

思维链虽然强大,但也有缺点。首先是它可能会生成表面看起来通顺合理、实际却完全错误的伪推理。

其次是极大地增加了Token的消耗。原本只需要几个字就能回答的问题,因为写出了长长的思考过程,消耗的字符量可能会暴增十倍以上,从而大幅增加使用成本。

最后是对于“2+2等于几”这种极其简单的常识性问题,开启思维链会导致过度复杂化,属于浪费资源。

5、背后的趣闻与发现

思维链的诞生其实是一个美丽的意外。2022年谷歌的研究员在给模型做测试时,仅仅是因为个人习惯在准备例子时多写了几行推理步骤,结果意外发现准确率从17%暴涨到了57%。

进一步的研究还表明,思维链具有“涌现”特征。这意味着它不是在所有模型上都有效,当模型规模太小时,用了思维链效果反而可能变差;只有当模型足够大、底层的基本推理能力被激活后,思维链才会成为一把威力巨大的“放大器”。

6、总结

思维链(CoT)是大模型领域的一项重大突破。它的核心逻辑是通过让模型“展示推理过程”,将复杂任务拆解为连续的、简单的自回归生成步骤,并赋予模型自我纠错的空间。尽管它会带来更高的字符消耗和成本,但它成功激活了大模型深层的逻辑推理潜力,是让AI应对复杂多步任务的关键技术。

九、Temperature(一)-控制创造力的旋钮

1、什么是 Temperature(温度)参数

在 AI 生成文本时,它其实是在做完形填空。每输入一段话,模型就会计算出接下来每个可能出现的词的概率。Temperature 就是一个在模型挑选下一个词之前,用来调整这些词概率分布的“旋钮”。它直接控制着 AI 的创造力和大胆程度。

2、不同温度值的神奇效果

当 Temperature 设为 0 时,AI 变得完全确定和保守。它每次都会雷打不动地选择那个概率最高的、最安全的词。你问它同一个问题 10 次,它的回答几乎完全一样,非常适合写代码或回答事实性问题。

当 Temperature 设为 0.7 到 1.0 时,AI 处于平衡状态。高概率词和低概率词的差距适中,它既能保证逻辑合理,又能给出有一定新鲜感的故事,适合日常对话和头脑风暴。

当 Temperature 设为 1.5 到 2.0 的高温时,AI 就开始变得“疯狂”和天马行空。原本那些几乎不可能被选中的低概率词,其被选中的几率会大幅上升,导致生成的文本极具艺术创造力,甚至带有超现实的科幻色彩,但代价是逻辑连贯性可能会下降。

3、温度背后的底层逻辑

模型在得出每个词的原始分数后,会通过一个数学公式来转换成概率。降温(T值变小)会让概率分布变得“尖锐”,厉害的词概率变得更高,差的词更没机会。升温(T值变大)会让概率分布变得“平缓”,所有词的概率差距被拉近,这就解释了为什么高温下 AI 的输出更不重复、更有创意。

4、全文核心总结

Temperature 参数是大模型开发中调节随机性的核心工具。通过拉大或缩小候选词之间的概率差距,它能够让同一个大模型在“严谨准确的专家”与“天马行空的艺术家”之间自由切换,开发者需要根据客服、文案或创意写作等不同的应用场景,来定制最适合的温度策略。

十、Top-p(二)-核采样的动态控制

1、什么是 Top-p 采样

Top-p 采样(也叫核采样)是大模型控制生成内容的另一种方法。它的核心逻辑是:先把所有可能的词按照概率从高到低排序,然后从头开始把概率相加,直到累加的概率达到你设定的值(即 p 值)。模型最后只从这批累加达标的“头部词”中进行挑选,其余不达标的低概率词则会被直接过滤掉。

例如,当 Top-p 设为 0.9 时,模型会把概率排在前面、加起来刚好达到 90% 的那几个词圈出来作为候选集,剩下的 10% 长尾低概率词直接淘汰,接着在候选集里重新计算概率并随机抽样。

2、Top-p 与 Temperature 的动态区别

虽然 Temperature(温度)和 Top-p 都能控制模型的创造力,但它们的方式不同。Temperature 是固定地调整所有词的概率分布(低温让高概率更强,高温拉平差距);而 Top-p 的最大优势在于“动态性”,它会根据模型当时的自信程度来动态改变候选词的数量。

当模型对接下来的话非常确定时(比如“这部电影很好”),前两三个词的概率相加就能轻松达到 90%,候选集就会变得很小,输出更稳定;而当模型不确定时(比如“未来科技会……”),很多词的概率都差不多,需要凑齐十几个词才能达到 90%,候选集就会自动变大,从而允许更多的探索和创造力。

3、常见参数值与混用顺序

在实际应用中,Top-p 的典型设置包括:0.1 表示极度保守,效果接近低温度;0.9 是最常用的平衡点(如 ChatGPT 的默认值),既能保留合理的丰富度,又能过滤长尾乱码;1.0 则表示完全不限制。

如果同时调整 Temperature 和 Top-p,系统的执行顺序是先计算原始概率,接着用 Temperature 变形概率分布,然后用 Top-p 筛选出候选词,最后进行抽样。不过,OpenAI 等官方通常建议两者只调其一,不建议同时调整,以保持参数的可解释性。

4、全文核心总结

Top-p 采样通过“动态累加概率”的方式筛选候选词,其核心价值在于它能根据上下文的确定性,自动收缩或扩大候选范围。这使得大模型在面对确定性话题时保持连贯精准,在面对开放性话题时展现创造力,同时有效过滤掉了概率极低的乱码和无关词。

十一、Top-p(三)-随机性与参数设置

1、为什么大模型需要随机性

如果AI总是选择概率最高的那个词,它的回答就会变得完全一样、机械且无聊。很多任务并没有唯一的标准答案。引入随机性不仅可以避免重复,还能让AI探索更多样化的解决方案,甚至通过一些意想不到的词汇组合来产生“创造力”。这种变化性也让AI的对话显得更像人类、更自然。

2、不同任务的推荐参数设置

在调用大模型API时,主要通过调节 Temperature(温度)和 Top-p(核采样)来控制随机性。针对不同任务有不同的最佳组合。

对于事实性问答,目标是准确和一致,推荐将 Temperature 设为 0 到 0.3,Top-p 设为 0.1 到 0.5。

对于代码生成,目标是正确和可运行,推荐将 Temperature 设为 0 到 0.2,Top-p 设为 0.1。

对于创意写作,目标是新颖和有趣,推荐将 Temperature 设为 0.7 到 1.2,Top-p 设为 0.9 到 0.95。

对于头脑风暴,目标是产生多样性的想法,推荐将 Temperature 设为 0.8 到 1.5,Top-p 设为 0.95。一般来说,建议只调整这两个参数中的任意一个,而不是同时调整。

3、在哪里可以调整这些参数

如果你使用的是网页版或手机App的大模型,这些参数通常是固定且无法由用户直接调整的,只能通过提示词去间接影响。如果你是开发者,通过API调用大模型,则可以完全自由地在代码里控制这些参数。

4、什么是“核采样”以及工程现实

Top-p 采样又被称为“核采样”,这个名字灵感来源于核物理学。它把高概率的词汇集合比喻为紧密聚集的“原子核”,把低概率的词比喻为外围的“电子云”,采样时只在核心区域选择,从而过滤掉边缘词汇。

值得注意的是,即使把 Top-p 设置为最高的 1.0,在实际的工程实现中,系统依然会通过预过滤极低概率词、截断词表(如只保留分数前1000个词)以及受到浮点数精度限制等方式,过滤掉一部分词汇。因此,Top-p 1.0 只是逻辑上的全部,而非物理上的全部。

5、总结

随机性是AI产生创造力和自然对话的关键。在实际应用中,需要根据任务的性质(如追求准确的代码生成还是追求发散的创意写作)来调节参数,且在工程实现上,即使参数开到最大,系统也会为了计算效率而进行底层的截断过滤。

十二、幻觉

1、什么是AI幻觉

AI幻觉指的是人工智能生成的内容表面上听起来非常流利、专业且合情合理,但实际上却是虚假的、凭空编造的或者与客观事实完全不符的现象。最让人困扰的是,大模型在胡说八道时,表现得和说真话时一模一样,充满了自信和说服力。

2、幻觉的常见类型

事实性幻觉:大模型会凭空捏造信息,比如编造不存在的学术论文及编码、虚构历史事件、篡改统计数据等。

能力幻觉:大模型会声称自己做了做不到的事,比如纯文本模型谎称自己看到了图片,或者没有联网功能却声称已经帮你下载了网页。

逻辑幻觉:大模型在推理过程中表面上合逻辑,但实际推导链条有误,或者混淆了因果关系。

填充性幻觉:当用户提供的信息不足时,大模型为了把话答圆,会自作聪明地编造细节来填补空白。

3、为什么会产生幻觉

核心在于大模型的训练机制。它的本质是“预测下一个最可能出现的词”,而不是“判断这句话是真是假”。它的知识来源于海量文本的统计规律。

在互联网数据中,“有回答”的概率远高于“我不知道”,且人类在调整模型时更倾向于喜欢“流畅、详细、有帮助”的回答,这导致大模型哪怕不知道也会倾向于硬编。

此外,大模型生成内容是“一个词接一个词”的自回归过程。一旦第一步开始编造,后续的生成就会为了圆谎而被锁定在错误的轨道上,形成雪球效应。

4、幻觉的危害

幻觉不仅是好玩的漏洞,还会带来严重风险。它会传播错误信息,误导人们的决策。例如在医疗、法律和投资等严谨领域,相信AI的幻觉可能导致严重的健康损害、官司失败或经济损失。曾经就有律师因直接使用AI编造的虚假法庭判例而遭到法院罚款。

5、核心总结

AI幻觉是语言模型基于“词频预测和模式匹配”本质而带来的先天局限。尽管技术在不断进步,初级事实错误已大幅减少,但只要大模型依然依赖海量资料进行统计生成,幻觉就无法被完全消灭。在使用AI处理事实性、专业性问题时,人类必须保持警惕并核实关键信息。

评论