从通用奖励到针对性奖励:超越GPT-4的开放式长上下文生成
计算与语言
2025-06-23 v1 人工智能
摘要
当前大语言模型(LLM)的长上下文研究主要聚焦于长上下文理解,而开放式长文本生成(Open-LTG)仍受到不足的关注。训练长上下文生成模型需要精选的黄金标准参考数据,而对于信息丰富的开放式LTG任务,这类数据通常不存在。然而,现有方法仅使用通用评估作为奖励信号,限制了准确性。为弥合这一差距,我们提出ProxyReward——一种创新的基于强化学习(RL)的框架,包括数据集和奖励信号计算方法。首先,ProxyReward数据集通过简单提示实现自动生成,无需大量标注数据或显著的人工 effort。其次,ProxyReward信号对特定问题的信息完整性和准确性进行针对性评估。实验结果表明,我们的方法ProxyReward甚至超越了GPT-4-Turbo。在广泛使用的开源模型上进行训练时,可将Open-LTG任务性能提升约20%,同时优于LLM-as-a-Judge方法。我们的工作提供了有效的方法来增强大语言模型解决复杂开放性问题的能力。
引用
@article{arxiv.2506.16024,
title = {From General to Targeted Rewards: Surpassing GPT-4 in Open-Ended Long-Context Generation},
author = {Zhihan Guo and Jiele Wu and Wenqian Cui and Yifei Zhang and Minda Hu and Yufei Wang and Irwin King},
journal= {arXiv preprint arXiv:2506.16024},
year = {2025}
}