基于人类反馈的强化学习

面向语言模型的后训练RLHF简明指南

作者:Nathan Lambert 译者:Junwei He

本章目录

定义与背景

本章收录了RLHF过程中常用的定义、符号与操作,并简要介绍了语言模型(本书讨论的主要优化对象)的基本知识。

语言建模概述

现代大多数语言模型的训练目标,是以自回归(autoregressive)方式学习一系列token(词、子词或字符)序列的联合概率分布。 自回归的含义是:每个token的预测都依赖于序列中之前的内容。 给定一个token序列 \(x = (x_1, x_2, \ldots, x_T)\),模型会将整个序列的概率分解为一系列条件分布的乘积:

\[P_{\theta}(x) = \prod_{t=1}^{T} P_{\theta}(x_{t} \mid x_{1}, \ldots, x_{t-1}).\qquad{(1)}\]

为了让模型能够准确预测上述概率,训练目标通常是最大化模型对训练数据的似然。 实际做法是最小化负对数似然(NLL)损失:

\[\mathcal{L}_{\text{LM}}(\theta)=-\,\mathbb{E}_{x \sim \mathcal{D}}\left[\sum_{t=1}^{T}\log P_{\theta}\left(x_t \mid x_{<t}\right)\right]. \qquad{(2)}\]

在实际工程中,通常采用交叉熵损失(cross-entropy loss)来度量每个token的预测,把模型预测与真实token逐一比对。

语言模型的实现形式多种多样。 现代主流语言模型(如ChatGPT、Claude、Gemini等)大多采用仅解码器结构的Transformer [1]。 Transformer的核心创新在于充分利用自注意力机制(self-attention)[2],使模型能够直接关注上下文中的概念,并学习复杂的映射关系。 在本书(尤其是第7章奖励模型部分),我们会讨论如何为Transformer添加新的head或修改语言建模(LM)head。 LM head是一个最终的线性投影层,用于将模型内部的embedding空间映射到分词器空间(即词表/vocabulary)。 通过不同的head,可以复用模型内部结构,微调输出不同类型的结果。

机器学习相关定义

\[ D_{KL}(P || Q) = \sum_{x \in \mathcal{X}} P(x) \log \left(\frac{P(x)}{Q(x)}\right) \qquad{(3)}\]

自然语言处理相关定义

强化学习相关定义

RLHF专有定义

拓展术语表

\[\mathcal{L}_{\text{KD}}(\theta) = -\,\mathbb{E}_{x \sim \mathcal{D}}\left[\sum_{t=1}^{T}\sum_{v\in\mathcal{V}} P_{\phi}(v \mid x_{<t}) \log P_{\theta}(v \mid x_{<t})\right]. \qquad{(6)}\]

这里 \(\mathcal{V}\) 为词表,温度取 1;完整分布蒸馏需要对词表求和,不能只取真实下一个 token 的教师概率。

参考文献

[1]
A. Vaswani 等, 《Attention is All you Need》, 收入 Neural Information Processing Systems, 2017. 载于: https://api.semanticscholar.org/CorpusID:13756489
[2]
D. Bahdanau, K. Cho, 和 Y. Bengio, 《Neural Machine Translation by Jointly Learning to Align and Translate》, CoRR, 卷 abs/1409.0473, 2014, 载于: https://api.semanticscholar.org/CorpusID:11212020
[3]
G. Hinton, O. Vinyals, 和 J. Dean, 《Distilling the knowledge in a neural network》, arXiv preprint arXiv:1503.02531, 2015.
[4]
G. Team 等, 《Gemma 2: Improving open language models at a practical size》, arXiv preprint arXiv:2408.00118, 2024.
[5]
R. Agarwal 等, 《On-policy distillation of language models: Learning from self-generated mistakes》, 收入 The Twelfth International Conference on Learning Representations, 2024.
[6]
J. Wei 等, 《Chain-of-thought prompting elicits reasoning in large language models》, Advances in neural information processing systems, 卷 35, 页 24824~24837, 2022.
[7]
T. Kojima, S. S. Gu, M. Reid, Y. Matsuo, 和 Y. Iwasawa, 《Large language models are zero-shot reasoners》, Advances in neural information processing systems, 卷 35, 页 22199~22213, 2022.
← 上一章: 关键相关工作 下一章: 训练概览 →