只需提示:仅-prompting 自奖励型在线偏好优化
人工智能
2024-10-15 v2
摘要
我们聚焦于基于自奖励方法的在线强化学习从人类反馈(RLHF)挑战。在在线 RLHF 中,获取反馈需要与环境交互,这在使用额外奖励模型或 GPT-4 API 时成本较高。当前自奖励方法高度依赖判别器的判断能力,这些方法对大规模模型有效,但难以迁移到较小的模型。为此,我们提出一种 novel、only-prompting self-rewarding online algorithm,不依赖判别能力即可生成偏好数据集。此外,我们采用细粒度算术控制正负样本间最优间隙,在训练后期生成更多困难负样本,以帮助模型更好地捕捉细微的人类偏好。最后,我们在两个 base 模型(Mistral-7B 和 Mistral-Instruct-7B)上进行大量实验,显著提升了参考模型的性能,在 AlpacaEval 2.0 的 Length-controlled Win Rates 中达到 34.5%。
关键词
引用
@article{arxiv.2409.17534,
title = {Just Say What You Want: Only-prompting Self-rewarding Online Preference Optimization},
author = {Ruijie Xu and Zhihan Liu and Yongfei Liu and Shipeng Yan and Zhaoran Wang and Zhi Zhang and Xuming He},
journal= {arXiv preprint arXiv:2409.17534},
year = {2024}
}