IPO:您的语言模型实际上是个偏好分类器
计算与语言
2025-03-21 v2
摘要
强化学习从人类反馈(RLHF)已成为对齐大型语言模型(LLM)与人类偏好主要方法。虽然它使 LLM 能够实现人类水平的对齐,但由于依赖训练外部奖励模型或人类标注的偏好,往往产生显著的计算和经济成本。本文提出了隐式偏好优化(IPO),一种替代方法,利用生成式 LLM 作为偏好分类器,从而减少对外部人类反馈或奖励模型获取偏好的依赖。我们使用 RewardBench 对 LLM 的偏好分类能力进行全面评估,评估不同规模、架构和训练水平的模型,以验证我们的假设。此外,我们研究了 LLM 的自我改进能力,通过为给定指令生成多个响应,并使用模型本身作为 Direct Preference Optimization(DPO)训练的偏好分类器。我们的发现表明,通过 IPO 训练的模型在获取偏好方面,性能与使用最先进奖励模型的模型相当。
引用
@article{arxiv.2502.16182,
title = {IPO: Your Language Model is Secretly a Preference Classifier},
author = {Shivank Garg and Ayush Singh and Shweta Singh and Paras Chopra},
journal= {arXiv preprint arXiv:2502.16182},
year = {2025}
}