RainbowPO:统一的偏好优化改进集成框架
人工智能
2025-03-04 v2
摘要
最近,诸多偏好优化算法作为 Direct Preference Optimization(DPO)家族的延伸被引入。虽然这些方法成功地使模型与人类偏好相匹配,但对其额外组成部分的贡献缺乏了解,而且稀缺公平且一致的比较,使人们难以辨认出哪些组件真正提升了下游性能。本文提出 RainbowPO,一个统一框架,通过将现有 DPO 方法的关键组件分为七大方向来解构其有效性。我们将这些组件整合到单个连贯目标中,增强每个单独元素的性能。通过大量实验,我们展示 RainbowPO 超越现有 DPO 变体。此外,我们提供的见解可指导研究人员开发新的 DPO 方法,并帮助实践者在实际中实施。
引用
@article{arxiv.2410.04203,
title = {RainbowPO: A Unified Framework for Combining Improvements in Preference Optimization},
author = {Hanyang Zhao and Genta Indra Winata and Anirban Das and Shi-Xiong Zhang and David D. Yao and Wenpin Tang and Sambit Sahu},
journal= {arXiv preprint arXiv:2410.04203},
year = {2025}
}