CREAM:一致性正则化的自奖励语言模型
机器学习
2025-04-29 v5 计算与语言
摘要
最近的自奖励大型语言模型(LLM)已成功应用 LLM-as-a-Judge 技术,通过无需人工标注偏好数据即可迭代提高对齐性能。在这些方法中,通常同时使用相同的 LLM 既作为策略模型(生成响应),又作为奖励模型(评分和排序这些响应)。然后将排名后的响应用作偏好对来训练 LLM(例如使用 DPO)。然而值得注意的是,在整个过程中没有保证奖励和排序的准确性,这对于确保准确的奖励和高质量的偏好数据至关重要。来自相对较小的 LLM(例如 7B 参数)的实证结果也表明,在某些情况下,自奖励的改进在经过几次迭代后可能会减弱,我们推测这是由于奖励系统中积累的偏差所致。这种偏差可能导致 LLM 的可靠偏好数据不可靠。为解决此问题,我们首先提出并分析了自奖励语言模型的通用迭代偏好微调框架。随后,我们在该通用框架中引入正则化,以缓解自奖励过程中对偏好标签的过度自信。基于这些理论见解,我们提出了一致性正则化的自奖励语言模型(CREAM),通过利用不同迭代中奖励的一致性来正则化自奖励训练,帮助模型从更可靠的偏好数据中学习。通过这种显式正则化,我们的实证结果表明 CREAM 在提高奖励一致性和对齐性能方面具有优势。代码已公开发布于 https://github.com/Raibows/CREAM。
引用
@article{arxiv.2410.12735,
title = {CREAM: Consistency Regularized Self-Rewarding Language Models},
author = {Zhaoyang Wang and Weilei He and Zhiyuan Liang and Xuchao Zhang and Chetan Bansal and Ying Wei and Weitong Zhang and Huaxiu Yao},
journal= {arXiv preprint arXiv:2410.12735},
year = {2025}
}
备注
To appear at ICLR 2025