中文

OpenGenAlign:面向可靠奖励建模的开放式长上下文生成偏好数据集与基准

计算与语言 2025-11-13 v3

摘要

奖励建模在评估和改进大型语言模型 (LLM) 的生成方面至关重要。虽然近期大量研究表明其在提高安全性、有用性、推理和指令遵循能力方面的可行性,但其在开放式长上下文生成方面的能力和泛化仍鲜有探索。本文引入 OpenGenAlign,一个旨在开发评估和改进无幻觉、全面、可靠和高效开放式长上下文生成的奖励模型的框架和高质量数据集。我们定义了四个关键指标来评估生成质量,并开发了一个自动化管道,用于评估多个 LLM 在长上下文 QA、Data-to-Text 和 Summarization 场景下的输出,最终得到 33K 高质量偏好数据,人类一致率为 81\%。实验结果首先表明,现有的奖励模型在留置的基准上表现次优。我们的训练奖励模型在基准中取得优异性能,并有效改进了使用强化学习 (RL) 的策略模型的生成质量。此外,OpenGenAlign 可用于有效的引导生成。我们进一步展示了 OpenGenAlign 可与来自其他领域的奖励数据集成,以获得更好性能。

关键词

引用

@article{arxiv.2501.13264,
  title  = {OpenGenAlign: A Preference Dataset and Benchmark for Trustworthy Reward Modeling in Open-Ended, Long-Context Generation},
  author = {Hanning Zhang and Juntong Song and Juno Zhu and Yuanhao Wu and Tong Zhang and Cheng Niu},
  journal= {arXiv preprint arXiv:2501.13264},
  year   = {2025}
}

备注

Preprint update