中文

奖励汤:通过插值在多样奖励上微调的权重以实现帕累托最优对齐

机器学习 2023-10-17 v2 人工智能 计算机视觉与模式识别

摘要

基础模型首先在大量无监督数据集上预训练,然后在标注数据上微调。强化学习,特别是来自人类反馈的强化学习(RLHF),可进一步使网络与预期用途对齐。然而,代理奖励中的缺陷可能阻碍训练并导致次优结果;现实任务中目标的多样性以及人类观点的分歧加剧了该问题。本文提出通过遵循多策略策略来接纳多样奖励的异质性。我们并非聚焦于单一的先验奖励,而是旨在整个偏好空间上实现帕累托最优的泛化。为此,我们提出奖励汤(rewarded soup),先独立地专门化多个网络(每个代理奖励一个),然后线性插值它们的权重。这在经验上取得成功,因为我们证明了当从共享的预训练初始化出发在多样奖励上微调时,权重保持线性连通。我们展示了该方法在文本到文本(摘要、问答、有用助手、评论)、文本到图像(图像描述、文本到图像生成、视觉定位、VQA)以及控制(运动)任务上的有效性。我们希望增强深度模型的对齐,以及它们如何以其全部多样性与世界交互。

关键词

引用

@article{arxiv.2306.04488,
  title  = {Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards},
  author = {Alexandre Ramé and Guillaume Couairon and Mustafa Shukor and Corentin Dancette and Jean-Baptiste Gaya and Laure Soulier and Matthieu Cord},
  journal= {arXiv preprint arXiv:2306.04488},
  year   = {2023}
}