中文

自监督属性感知动态偏好排序对齐

计算与语言 2025-02-19 v1 人工智能

摘要

从人类反馈中进行强化学习及其变体方法在引导生成有帮助、无害、诚实的响应方面表现出色。然而,这些方法大多依赖昂贵的人工标注的两两比较,难以适用于列表级场景,如社区问答。此外,人类偏好受响应中多种内在因素的影响,导致决策不一致。因此,我们提出一种名为SeAdpra(Self-supervised Attribute-aware Dynamic Preference Ranking Alignment)的方法。该方法基于属性感知距离因子(APDF)量化响应之间的偏好差异,并动态确定列表级对齐顺序。进一步,它实现了对偏好差异的细粒度学习,使能够精准对齐最优响应。我们特意构建了一个具有挑战性的代码偏好数据集StaCoCoQA,并引入更具成本效益和可扩展性的偏好评估指标:PrefHit和PrefRecall。大量实验结果表明,SeAdpra在StaCoCoQA和来自八个热门领域的偏好数据集上均表现出卓越的性能和广泛的可泛化性。

关键词

引用

@article{arxiv.2502.12189,
  title  = {Self-supervised Attribute-aware Dynamic Preference Ranking Alignment},
  author = {Hongyu Yang and Qi Zhao and Zhenhua hu and Rui Li},
  journal= {arXiv preprint arXiv:2502.12189},
  year   = {2025}
}