中文

检测基于LLM的奖励模型中的前缀偏差

计算与语言 2025-11-03 v2 人工智能

摘要

基于人类反馈的强化学习(RLHF)已成为使用人类偏好数据对语言模型进行任务特定微调的关键范式。虽然众多公开可用的偏好数据集提供了响应的成对比较,但由此产生的奖励模型中潜在偏差的探索仍不足。在本研究中,我们引入了新方法来检测和评估前缀偏差——一种由查询前缀的微小变化触发的模型偏好系统性偏移——在基于此类数据集训练的 LLM 奖励模型中。我们利用这些指标揭示了偏好模型在种族和性别维度上的显著偏差。我们的综合评估涵盖了多样化的开源偏好数据集和奖励模型架构,证明了无论底层模型架构如何,都容易受到此类偏差的影响。此外,我们提出了一种数据增强策略来缓解这些偏差,展示了其在减少前缀偏差影响方面的有效性。我们的发现强调了在为开发公平可靠的奖励模型进行的数据集设计和评估中,需要关注偏差意识,为关于 AI 公平性的更广泛讨论做出了贡献。

关键词

引用

@article{arxiv.2505.13487,
  title  = {Detecting Prefix Bias in LLM-based Reward Models},
  author = {Ashwin Kumar and Yuzi He and Aram H. Markosyan and Bobbie Chern and Imanol Arrieta-Ibarra},
  journal= {arXiv preprint arXiv:2505.13487},
  year   = {2025}
}