变分最佳-N对齐
计算与语言
2025-03-05 v3 人工智能
机器学习
摘要
最佳-N(Best-of-N,BoN)是一种流行且有效的算法,用于将语言模型对齐到人类偏好。该算法的工作方式如下:在推理时,绘制N个样本,并返回由奖励模型评估得分最高的样本作为输出。尽管该方法有效,但计算成本高昂;它将采样吞吐量降低N倍。使BoN在推理时更高效的一种策略是微调语言模型以模拟BoN在推理时的行为。为此,我们推导了BoN算法所诱导的分布。随后我们提出使用变分方法对语言模型进行微调,以最小化到BoN分布的反向KL发散。我们的做法类似于均场变分推断,因此我们将其称为变分BoN(vBoN)。只要这种微调成功且我们获得良好的近似,我们就将推理成本降低了N倍。我们在受控生成和摘要任务上的实验表明,BoN是最有效的对齐方法,而我们的变分对BoN的近似在性能上最接近BoN,并超越了使用标准KL约束强化学习目标微调的模型。在受控生成任务中,vBoN在奖励与KL发散的帕累托前沿上出现频率更高。,在摘要任务中,vBoN在各种采样温度下实现高奖励值。
引用
@article{arxiv.2407.06057,
title = {Variational Best-of-N Alignment},
author = {Afra Amini and Tim Vieira and Elliott Ash and Ryan Cotterell},
journal= {arXiv preprint arXiv:2407.06057},
year = {2025}
}
备注
Accepted at ICLR 2025