LongReward:利用 AI 反馈改进长上下文大语言模型
计算与语言
2024-10-29 v1 机器学习
摘要
尽管在开发长上下文大语言模型 (LLM) 方面取得了显著进展,但用于监督微调 (SFT) 的 LLM 合成数据的质量受损,常常影响 SFT 模型的长上下文性能并导致固有的局限性。原则上,带有适当奖励信号的强化学习 (RL) 可以进一步增强模型的能力。然而,如何在长上下文场景中获得可靠的奖励仍未得到探索。为此,我们提出了 LongReward,这是一种新颖的方法,它利用现成的 LLM 从四个人类价值维度(有用性、逻辑性、忠实性和完整性)为长上下文模型响应提供奖励,每个维度都配有精心设计的评估流程。通过结合 LongReward 和离线 RL 算法 DPO,我们能够有效改进长上下文 SFT 模型。我们的实验表明,LongReward 不仅显著提高了模型的长上下文性能,还增强了它们遵循短指令的能力。我们还发现,使用 LongReward 的长上下文 DPO 和传统的短上下文 DPO 可以一起使用,而不会损害任何一方的性能。
引用
@article{arxiv.2410.21252,
title = {LongReward: Improving Long-context Large Language Models with AI Feedback},
author = {Jiajie Zhang and Zhongni Hou and Xin Lv and Shulin Cao and Zhenyu Hou and Yilin Niu and Lei Hou and Yuxiao Dong and Ling Feng and Juanzi Li},
journal= {arXiv preprint arXiv:2410.21252},
year = {2024}
}