中文

上下文中的奖励:通过动态偏好调整实现基础模型的多目标对齐

机器学习 2024-10-17 v6 人工智能 计算与语言

摘要

我们研究了基础模型与人类偏好的多目标对齐问题,这是构建有益且无害的 AI 系统的关键步骤。然而,使用强化学习 (RL) 微调大型基础模型通常成本高昂且不稳定,而人类偏好的多维性、异质性和冲突性进一步复杂化了对齐过程。在本文中,我们提出了上下文中的奖励 (Rewards-in-Context, RiC) 方法,该方法在提示上下文中基于多个奖励来调节基础模型的响应,并应用监督微调进行对齐。RiC 的显著特征是简单性和适应性,因为它仅需对单个基础模型进行监督微调,并支持在推理阶段动态调整用户偏好。受抽象凸优化问题解析解的启发,我们的动态推理时调整方法能够逼近多目标的帕累托最优解。实证证据表明,我们的方法能有效将大型语言模型 (LLMs) 和扩散模型与多样化的奖励对齐,其 GPU 耗时仅为多目标 RL 基线的 10% 左右。

关键词

引用

@article{arxiv.2402.10207,
  title  = {Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment},
  author = {Rui Yang and Xiaoman Pan and Feng Luo and Shuang Qiu and Han Zhong and Dong Yu and Jianshu Chen},
  journal= {arXiv preprint arXiv:2402.10207},
  year   = {2024}
}

备注

Accepted by ICML 2024