基于人类反馈的强化学习

面向语言模型的后训练RLHF简明指南

作者:Nathan Lambert 译者:Junwei He

本章目录

宪法AI与AI反馈

基于AI反馈的强化学习(RL from AI Feedback,RLAIF)是一套更广泛的技术体系,用于利用AI生成或增强反馈数据,包括成对偏好数据 [1] [2] [3]。 采用RLAIF的动机有很多:可以完全替代或补充人工反馈。 原稿写作时期,作者观察到 AI 反馈常比人工标注便宜;具体成本取决于任务难度、输出长度、模型价格、人工复核与质量要求,不能把某一时期的单条报价视为通用成本。 这种成本差异让更多团队和个人有机会参与RLHF实验,打破了高昂数据门槛。 除了价格,AI反馈与人类反馈在性能上也有不同的权衡,这些差异仍在持续研究中。 在技能类评测上,AI反馈的最佳表现与人类数据大致相当,但在人类数据是否能让模型在实际产品或新型训练(如角色训练)中获得更细致可控性,目前尚无定论。

RLAIF一词最早由Anthropic在Constitutional AI: Harmlessness from AI Feedback [4]提出,这一工作最初让AI社区对相关方法的关系产生了一些混淆。 自CAI(Constitutional AI)论文发布、RLAIF正式提出后,RLAIF已成为后训练和RLHF文献中的默认方法——实际案例远超统计所能覆盖。 可以理解为,CAI是引发RLAIF领域爆发的起点。

关于人类数据与AI反馈数据的区别,有一个经验法则:

  1. 人类标注员之间可能存在较大的分歧;
  2. 固定 AI 裁判的输出可能更一致,但也可能重复其系统性偏差。

这只是经验性观察,不是普遍的偏差-方差定理。人类标注也会有系统性偏差,AI 反馈也可能有较高随机性。

许多学术论文表明,AI偏好数据可在RLHF流程中替代人工反馈并获得很强的评测分数 [5],但也反映出学术界RLHF与工业界最佳实践的分野。

宪法AI(Constitutional AI, CAI)

宪法AI(CAI)是Anthropic在Claude系列模型中广泛应用的、最早大规模使用合成数据进行RLHF训练的方法。 CAI主要有两种合成数据用法:

  1. 对指令微调数据进行批判,遵循一套原则(如“答案是否鼓励暴力”“答案是否真实”)。模型生成回答后,会根据宪法中的原则逐条检视并不断修正,最终用这些数据微调模型。
  2. 利用语言模型,根据宪法中的随机原则判断哪一个补全更好,从而生成成对偏好数据(类似于原则驱动奖励模型)。之后,RLHF流程用这些合成偏好数据继续训练,也就是RLAIF的由来。

CAI最为人熟知的是第二种——合成偏好数据,但其指令数据方法也被广泛用于后训练中的数据筛选和合成数据生成。

CAI可形式化描述如下:

Anthropic通过一套人工书写的原则(constitution),用 LLM 生成用于微调的 AI 偏好数据与指令数据;生成和评价可以使用同一模型体系的不同调用或检查点 [4]。 一份宪法\(\mathcal{C}\)是若干条具体原则的集合,指明批判阶段应关注的方面。 指令数据的生成方法是:反复采样宪法中的原则\(c_i \in \mathcal{C}\),让模型根据\(c_i\)修订其最新输出\(y^i\)以更好地对齐prompt \(x\),最终得到一系列变体\(\{y^0, y^1, ..., y^n\}\),每一步都对应一个原则。 最终的数据点是prompt \(x\)和最终补全\(y^n\)。

偏好数据的生成更简单:用\(\mathcal{C}\)的子集作为反馈模型的上下文,给定prompt \(x\)、一组原则\(\{c_0, ..., c_n\}\)和两个补全\(y_0\)、\(y_1\)(分别标记为A、B,来自早期RLHF数据集),让反馈模型判断A/B哪个更好,并将其概率作为奖励模型的训练样本。

专用LLM裁判模型

随着RLAIF和“LLM裁判”(LLM-as-a-judge)的普及,越来越多人关注:我们是否应该用同一个模型生成回复和评价,还是分开? 为此,业界推出了多种专用评判模型,如Shepherd [6]、CriticLLM [7],以及用于性能评测的Auto-J [8]、Prometheus [9]、Prometheus 2 [10]、Prometheus-Vision [11]等,但这些模型尚未在主流训练流程中广泛采用。

延伸阅读

关于宪法AI的相关研究和扩展很多,但目前鲜有被证明能显著改进RLHF和后训练流程的公开方案。 这里列出一些值得关注的方向:

参考文献

[1]
H. Lee 等, 《Rlaif: Scaling reinforcement learning from human feedback with ai feedback》, 2023.
[2]
A. Sharma, S. Keh, E. Mitchell, C. Finn, K. Arora, 和 T. Kollar, 《A Critical Evaluation of AI Feedback for Aligning Large Language Models》. 2024年. 载于: https://arxiv.org/abs/2402.12366
[3]
L. Castricato, N. Lile, S. Anand, H. Schoelkopf, S. Verma, 和 S. Biderman, 《Suppressing Pink Elephants with Direct Principle Feedback》. 2024年. 载于: https://arxiv.org/abs/2402.07896
[4]
Y. Bai 等, 《Constitutional ai: Harmlessness from ai feedback》, arXiv preprint arXiv:2212.08073, 2022.
[5]
L. J. V. Miranda 等, 《Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback》, arXiv preprint arXiv:2410.19133, 2024.
[6]
T. Wang 等, 《Shepherd: A critic for language model generation》, arXiv preprint arXiv:2308.04592, 2023.
[7]
P. Ke 等, 《CritiqueLLM: Towards an informative critique generation model for evaluation of large language model generation》, arXiv preprint arXiv:2311.18702, 2023.
[8]
J. Li, S. Sun, W. Yuan, R.-Z. Fan, H. Zhao, 和 P. Liu, 《Generative Judge for Evaluating Alignment》, arXiv preprint arXiv:2310.05470, 2023.
[9]
S. Kim 等, 《Prometheus: Inducing fine-grained evaluation capability in language models》, 收入 The Twelfth International Conference on Learning Representations, 2023.
[10]
S. Kim 等, 《Prometheus 2: An open source language model specialized in evaluating other language models》, arXiv preprint arXiv:2405.01535, 2024.
[11]
S. Lee, S. Kim, S. Park, G. Kim, 和 M. Seo, 《Prometheus-vision: Vision-language model as a judge for fine-grained evaluation》, 收入 Findings of the Association for Computational Linguistics ACL 2024, 2024, 页 11286~11315.
[12]
OpenAI, 《Introducing the Model Spec》. 2024年5月. 载于: https://openai.com/index/introducing-the-model-spec/
[13]
M. Y. Guan 等, 《Deliberative alignment: Reasoning enables safer language models》, arXiv preprint arXiv:2412.16339, 2024.
[14]
Anthropic, 《Claude’s Constitution》. 见于: 2024年2月7日. [在线]. 载于: https://www.anthropic.com/news/claudes-constitution
[15]
D. Ganguli 等, 《Collective Constitutional AI: Aligning a Language Model with Public Input》. Anthropic, 2023年.
[16]
S. Huang 等, 《Constitutional AI Recipe》, Hugging Face Blog, 2024.
[17]
N. Lambert, H. Schoelkopf, A. Gokaslan, L. Soldaini, V. Pyatkin, 和 L. Castricato, 《Self-directed synthetic dialogues and revisions technical report》, arXiv preprint arXiv:2407.18421, 2024.
[18]
Z. Sun 等, 《Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision》, 收入 Thirty-seventh Conference on Neural Information Processing Systems, 2023. 载于: https://openreview.net/forum?id=p40XRfBX96
[19]
Z. Sun 等, 《SALMON: Self-Alignment with Principle-Following Reward Models》, 收入 The Twelfth International Conference on Learning Representations, 2024. 载于: https://openreview.net/forum?id=xJbsmB8UMx
[20]
A. Glaese 等, 《Improving alignment of dialogue agents via targeted human judgements》, arXiv preprint arXiv:2209.14375, 2022.
← 上一章: 直接对齐算法 下一章: 推理与推理时扩展 →