中文

用于优质开放式生成的成对偏好奖励与基于组的多样性增强

人工智能 2026-05-19 v1

摘要

当前的强化学习(RL)方法在可提供标量奖励的可验证环境中具有广泛的适用性和强大的能力。然而,在开放式生成任务中,验证响应的正确性仍然具有挑战性,且训练奖励模型会产生大量的计算和标注成本。此外,强化学习 (RLVR) 通常导致多样性坍塌并产生刻板或僵硬的输出,这些结果在开放域场景中尤为不可取。我们提出了成对偏好奖励与基于组的多样性增强 (PPR-GDE),一种更适合开放式生成的 RL 方法。PPR-GDE 不需要标量奖励,并将组级多样性纳入奖励信号中;它通过成对偏好奖励保留了主观评估的比较结构,通过交换响应顺序的重复比较来减轻评判者位置偏差,并引入了基于组的多样性奖励以显式鼓励响应组内的语义分散,所有这些奖励信号被整合到一个统一的组相对策略优化目标中。我们在角色扮演任务上实例化了 PPR-GDE,实验表明,与强大的 RL 基线相比,PPR-GDE 实现了更好的对齐质量以及表达多样性。进一步分析表明,成对偏好对于主观视角下的偏好对齐至关重要,而多样性度量在实现卓越的表达多样性和更广泛的语义覆盖方面发挥着重要作用。

关键词

引用

@article{arxiv.2605.18191,
  title  = {Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation},
  author = {Guining Cao and Jiaxin Peng and Chu Zeng and Yu Zhao and Shuangyong Song and Yongxiang},
  journal= {arXiv preprint arXiv:2605.18191},
  year   = {2026}
}

备注

Work in progress