基于人类反馈的强化学习

面向语言模型的后训练RLHF简明指南

作者:Nathan Lambert 译者:Junwei He

本章目录

合成数据与蒸馏

人类反馈强化学习(RLHF)最初的核心理念,是让人类对模型训练产生直接影响。 在RLHF早期,想要提升模型能力,几乎只能依赖人类数据。

只有人类,才能为问题生成足够高质量的回答用于训练; 只有人类,才能收集到可靠且细致的反馈数据来训练奖励模型。

但随着AI模型能力的提升,这一假设很快被打破。 合成数据的出现——其成本更低、迭代更快——让RLHF从唯一焦点转变为更广义的“后训练”,合成数据成为模型塑造的关键工具。

虽然有不少研究指出合成数据会导致“模型坍塌”或其他性能问题 [1],但保留真实数据、累积数据等不同训练设置下也有积极结果 [2] [3]。 合成数据确实可能导致模型性能下降,但这通常是因为数据高度重复,或仅用模型自身输出(导致分布收窄),数据多样性、筛选与真实数据混合有助于缓解风险,但不保证消除所有性能退化。

顶尖大模型离不开合成数据才能达到最佳性能。 现代后训练中的合成数据涉及多个环节——用语言模型从种子样本生成新训练prompt [4],修改已有prompt,生成prompt的补全 [5],用AI反馈生成偏好数据 [6],用AI过滤补全 [7],等等。 可以说,合成数据已成为后训练的核心。

合成数据之所以能产生如此深远的影响,是因为GPT-4级别模型的出现。 早期大模型(如Llama 2、GPT-3.5-Turbo)还无法稳定地生成或监督数据流程。 随后,更强模型在部分可验证任务上生成高质量答案的能力明显提升;这不能推广为所有领域都超越人类。 从GPT-3.5到GPT-4的升级,也让“LLM裁判”(LLM-as-a-judge)成为现实。 GPT-4及更强模型在生成反馈或评分时表现得更加稳健、一致。

自此之后,合成数据在大模型训练中的作用只增不减。 不过,人类数据在两个方面依然不可替代:

  1. 在模型尚未具备相关能力的边缘领域,仍需人类生成数据。一旦有第一个强模型出现,合成数据便会迅速扩散。
  2. 即使学术研究显示合成偏好数据表现同样优秀,主流大模型依然会用到人类偏好数据。人类偏好的真正作用在文献中仍在不断被探讨。

“蒸馏”(distillation)一词,是讨论合成数据在大模型中的最重要概念之一。 蒸馏最早来源于深度学习中的“教师-学生知识蒸馏”技术定义 [8]。

在业界口语中,蒸馏泛指用更强模型的输出来训练更小的模型。 在后训练阶段,蒸馏主要有两种常见形式:

  1. 作为数据引擎,贯穿后训练流程:用于生成指令补全、偏好数据(或宪法AI)、或RL的验证数据。
  2. 将特定技能从强模型迁移到弱模型,常见于数学推理、代码等专项能力。

第一种方式随着大模型能力超越人类而愈发流行。 GPT-4级模型让蒸馏能用于复杂任务(如数学、编程等)。 在企业内部,常见做法是先训练一个大型闭源模型(如Claude Opus、Gemini Ultra),内部用来生成更强的下游模型。 在开源生态中,常见做法是用 API 模型生成的输出训练小型开源模型 [9]。 在这一过程中,精心设计高质量prompt、对教师模型输出进行筛选,是提升最终效果的关键。

将专项技能迁移到小模型,同样遵循蒸馏原则——获取最优训练数据。 近年来,许多论文研究用强模型的小规模数据集提升小模型的对齐能力 [10]、数学推理 [11] [12]、 以及测试时扩展能力 [13]。

参考文献

[1]
I. Shumailov, Z. Shumaylov, Y. Zhao, N. Papernot, R. Anderson, 和 Y. Gal, 《AI models collapse when trained on recursively generated data》, Nature, 卷 631, 期 8022, 页 755~759, 2024.
[2]
M. Gerstgrasser 等, 《Is model collapse inevitable? breaking the curse of recursion by accumulating real and synthetic data》, arXiv preprint arXiv:2404.01413, 2024.
[3]
Y. Feng, E. Dohmatob, P. Yang, F. Charton, 和 J. Kempe, 《Beyond model collapse: Scaling up with synthesized data requires reinforcement》, 收入 ICML 2024 Workshop on Theoretical Foundations of Foundation Models, 2024.
[4]
Y. Wang 等, 《Self-instruct: Aligning language models with self-generated instructions》, arXiv preprint arXiv:2212.10560, 2022.
[5]
E. Beeching 等, 《NuminaMath 7B TIR》, Hugging Face repository. https://huggingface.co/AI-MO/NuminaMath-7B-TIR; Numina & Hugging Face, 2024年.
[6]
G. Cui 等, 《Ultrafeedback: Boosting language models with high-quality feedback》, 2023.
[7]
M. Li 等, 《Superfiltering: Weak-to-strong data filtering for fast instruction-tuning》, arXiv preprint arXiv:2402.00530, 2024.
[8]
G. Hinton, O. Vinyals, 和 J. Dean, 《Distilling the knowledge in a neural network》, arXiv preprint arXiv:1503.02531, 2015.
[9]
L. Tunstall 等, 《Zephyr: Direct Distillation of LM Alignment》, 收入 First Conference on Language Modeling, 2024. 载于: https://openreview.net/forum?id=aKkAwZB6JV
[10]
C. Zhou 等, 《Lima: Less is more for alignment》, Advances in Neural Information Processing Systems, 卷 36, 页 55006~55021, 2023.
[11]
K. Shridhar, A. Stolfo, 和 M. Sachan, 《Distilling reasoning capabilities into smaller language models》, Findings of the Association for Computational Linguistics: ACL 2023, 页 7059~7073, 2023.
[12]
C.-Y. Hsieh 等, 《Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes》, arXiv preprint arXiv:2305.02301, 2023.
[13]
N. Muennighoff 等, 《s1: Simple test-time scaling》, arXiv preprint arXiv:2501.19393, 2025.
← 上一章: 推理训练与推理时扩展 下一章: 评测与提示工程 →