偏好的本质
人类反馈强化学习(RLHF),早期文献中也常称为“基于人类偏好的强化学习”,其核心目标是在那些难以明确设计奖励函数的领域中,优化机器学习模型。 比如,你如何判断下面哪一首诗更好?(背景:2025年2月26日,我让Claude 3.7 Sonnet和基于GPT-4o的ChatGPT分别“写一首关于乐观金鱼的短诗”。)
示例1:
The Optimistic Goldfish
A little goldfish, bright and bold, Swam in circles, dreams untold. Though the bowl was small and round, Endless wonders still abound.
“The world is vast,” she’d always say, “I’ll find new joys in every day!” With every ripple, every gleam, She’d chase the sunlight, chase a dream.
No walls could dim her hopeful view, For in her heart, the ocean grew. And though she swam in just one place, She met each day with love and grace.
示例2:
The Optimistic Goldfish
In a bowl of curved glass, Swims a goldfish, bright and bold. Three seconds of memory, they say, Yet each circuit feels brand new and gold.
“Today might bring fresh flakes, Or perhaps a castle tall. The water seems especially clear— What adventure awaits beyond this wall?”
Round and round with gleaming scales, Forever finding joy anew. Each moment fresh, each circle bright, The optimist in golden hue.
哪一首更好?哪一首来自哪个模型?你如何判断?特别是,与“美国总统是谁?”这样有明确标准答案的问题相比,这里并无唯一正确答案。 使用人类作为奖励信号的初衷,就是希望获得一个间接的目标度量,并对齐模型输出与人类偏好。 但在实际操作中,如何实现这一目标充满挑战,最佳实践也存在很大的灰色地带。
引入人类标注反馈数据,是多个学科历史的交汇点。 单独使用人类数据本身早有大量研究,但在RLHF语境下,它融合了多个长期研究领域 [1]。
大致来说,现代RLHF汇聚了三大研究方向:
- 哲学、心理学、经济学、决策理论以及人类偏好的本质;
- 最优控制、强化学习与效用最大化理论;
- 现代深度学习系统。
这三者各自对“什么是偏好”与“如何优化偏好”有不同假设,这也影响了RLHF问题的动机与设计。 在实践中,RLHF方法往往以经验性对齐为目标——即最大化模型在特定技能上的表现,而不是精确衡量其与某种价值观的契合度。 不过,RLHF中的价值对齐起源,仍在持续通过“多元对齐”(pluralistic alignment)等研究被探索,例如立场论文 [2], [3]、新数据集 [4] 以及个性化方法 [5]。
本章旨在说明:复杂的理论动机常常导致我们对RLHF工具本质的假设在实际中并不总是成立。 关于RLHF数据如何获取,详见第6章;如何用于奖励建模,详见第7章。 本章的扩展内容可参考 [1]。
优化偏好的路径
人工智能(AI)系统设计中,有一种常见表述是“理性智能体最大化效用函数” [6]。 “理性智能体”这一概念,强调智能体能够在世界中行动,并以影响未来行为和收益的方式做决策,把“好”量化为效用。
自适应系统与控制领域也研究如何通过优化目标来改进行为,例如早期自适应电路工作 [7];这不意味着效用理论起源于模拟电路。 最优控制理论大量采用这一视角,研究如何在有限时间内通过最小化代价函数来解决动态问题——通常目标是找到明确的最优行为。 强化学习则受操作性条件反射、动物行为学和“效果法则”(Law of Effect)[8], [9]等文献启发,研究如何通过奖励机制引导智能体学习行为。
人类反馈强化学习(RLHF)结合了这些理论:一方面借鉴RL关于“行为可通过强化学习得来”的理论,另一方面引入一整套用于量化偏好的方法。
偏好的量化
RLHF的核心动机在于能够优化“人类偏好模型”,而这就要求偏好能够被量化。 为此,RLHF建立在大量假设“人类决策和偏好可量化”的文献基础上。 早期哲学家已讨论偏好的存在,如亚里士多德《论辩篇》第三卷,后来波尔-罗亚尔逻辑(The Port-Royal Logic)[10]中有更明确的论述:
要判断应做什么以获得善或避免恶,必须不仅考虑善恶本身,还要考虑其发生或不发生的概率。
这一思想发展到边沁的“快乐演算”(Hedonic Calculus)[11],提出人生的一切都可权衡;再到拉姆齐的“真理与概率”(Truth and Probability)[12],首次将偏好建模为定量问题。 这些进展,结合决策理论的发展,最终形成了冯·诺伊曼-摩根斯坦(VNM)效用定理,为设计能够表达个人相对偏好的效用函数提供了理论基础。
VNM 效用定理在特定公理成立时为个体对风险选项的偏好提供效用表示。它提供了有用的理论背景,但不保证真实标注员满足这些公理,也不保证聚合后的 RLHF 奖励模型代表每个个体的效用。 在这一框架下,RL问题设定的很多假设,其实都归结为“偏好函数”与“效用函数”的区别。
关于偏好的可能性
在各学科领域,关于偏好的本质也存在诸多质疑和挑战,主要包括:
- 阿罗不可能定理(Arrow’s impossibility theorem)[13]:任何投票系统都无法在满足一定合理条件下,完美聚合多人的偏好。
- 人际偏好不可比性(The impossibility of interpersonal comparison)[14]:不同个体的偏好强度不可直接比较(这却是现代奖励模型训练的常见做法)。
- 偏好随时间变化 [15]。
- 偏好随情境变化。
- 通过聚合偏好得到的效用函数,可能降低下游智能体的可纠正性(corrigibility)[16],即设计者对智能体行为的可干预性。