投影优化:多目标多群组 RLHF 的通用框架
机器学习
2025-02-25 v2 人工智能
摘要
基于人类反馈的强化学习(RLHF)是一种广泛使用的微调方法,用于将机器学习模型,特别是语言模型(LM),与人类偏好相匹配。通常存在多个驱动偏好的目标,因此人类更容易表达每个目标的比较,而非对两个选择的全局偏好。多目标 RLHF(MORLHF)旨在使用每个目标的偏好反馈,并通过聚合为单个统一目标来实现这些目标之间的帕累托最优性。然而,几乎所有先前工作都依赖线性聚合,这排除了偏向特定目标(如最差目标)的策略。唯一使用非线性聚合的已有方法由于其基于奖励的性质以及当聚合参数变化时需要重新训练的需求而计算成本高昂。在本工作中,我们通过将非线性聚合最大化问题转化为一系列子问题来解决这一限制。每个子问题仅涉及线性聚合,使其计算效率高。我们进一步扩展了该框架以处理多群组场景,其中每个群组对目标具有不同的权重。我们的方法能够实现跨所有群组的共识或最大化聚合目标。理论上,我们展示了该算法框架实现亚线性后悔,并可轻松适应奖励自由算法。实证上,依据我们的理论见解,我们提出了一个一旦获得各个目标的最优策略后几乎无需训练的算法。
引用
@article{arxiv.2502.15145,
title = {Projection Optimization: A General Framework for Multi-Objective and Multi-Group RLHF},
author = {Nuoya Xiong and Aarti Singh},
journal= {arXiv preprint arXiv:2502.15145},
year = {2025}
}