MOSLIM:通过奖励分类在提示中实现对齐多样化偏好
计算与语言
2025-05-28 v1 人工智能
摘要
大语言模型(LLM)的多目标对齐对于确保基础模型符合多样化的人类偏好至关重要。该领域的当前研究通常涉及针对各种偏好定制的多个策略或多个奖励模型,或者需要训练特定偏好的监督微调(SFT)模型。在本研究中,我们引入了一种新颖的多目标对齐方法 MOSLIM,该方法利用单一奖励模型和策略模型来解决多样化目标。MOSLIM 提供了一种通过提示控制这些目标的灵活方式,且在 SFT 阶段不需要偏好训练,允许数以千计的现成模型直接在该训练框架内使用。MOSLIM 利用多头奖励模型对问答对进行分类而非打分,随后利用映射函数将奖励模型的分类结果转换为奖励分数,并以此导出的标量奖励优化策略模型。我们在多个多目标基准上展示了所提方法的有效性,并对各种奖励模型规模和策略优化方法进行了消融研究。MOSLIM 方法在大多数结果上优于当前的多目标方法,同时与现有的策略优化方法相比,所需的 GPU 计算资源显著减少。
引用
@article{arxiv.2505.20336,
title = {MOSLIM:Align with diverse preferences in prompts through reward classification},
author = {Yu Zhang and Wanli Jiang and Zhengyu Yang},
journal= {arXiv preprint arXiv:2505.20336},
year = {2025}
}