Mutual-Taught:用于协同优化策略与奖励模型的方法
机器学习
2025-06-11 v2 人工智能
摘要
在大型语言模型(LLM)的偏好优化过程中,分布偏移可能在新生成的模型样本与用于训练奖励模型(RM)的数据之间产生。这种偏移会降低RM的有效性,从而严重影响策略模型(PM)的性能。为此,我们提出Mutual-Taught,这是一种无需额外人工标注即可迭代改进PM和RM的自训练方法。我们的ethods类似于期望最大化(EM)算法。在E步中,使用来自当前RM的反馈更新PM,引导PM更好地逼近潜在最优偏好分布。在M步中,我们通过构建PM在E步更新前后输出的训练数据来更新RM。此过程确保RM适应于不断演变的策略分布。实验结果表明,这一迭代方法在两个模型上均实现持续改进。具体而言,我们的8B策略模型LLaMA-3-8B-Instruct-MT在AlpacaEval-2上实现了54.1%的长度控制胜率,而我们的8B奖励模型FsfairX-LLaMA3-RM-MT在RewardBench上与GPT-4o-2024-08-06持平。
引用
@article{arxiv.2506.06292,
title = {Mutual-Taught for Co-adapting Policy and Reward Models},
author = {Tianyuan Shi and Canbin Huang and Fanqi Wan and Longguang Zhong and Ziyi Yang and Weizhou Shen and Xiaojun Quan and Ming Yan},
journal= {arXiv preprint arXiv:2506.06292},
year = {2025}
}
备注
Accepted to ACL 2025 (Main Conference)