灰度偏好学习:面向人类偏好的可解释且无偏见的奖励建模
计算与语言
2026-04-03 v1 人工智能
摘要
在语言模型中学习人类偏好仍然具有根本性挑战,因为奖励建模依赖于微妙的、主观的比较或灰度判断,而非明确的标签。本研究探讨了当前方法的局限性,并提出了一种特征增强框架以更好地捕捉人类判断的多维性质。利用 Anthropic HHRLHF 数据集,我们在标准配对偏好设置下评估了十种不同的大语言模型(LLM),基线性能低于 0.74 ROC AUC,凸显了该任务的难度。为解决这一问题,我们通过响应长度、拒绝指示器、毒性分数和提示-响应语义相似度等可解释信号丰富文本表示,使模型能够显式地捕捉有用性、安全性和相关性的关键方面。所提出的混合方法在所有模型上均产生一致改进,最高达到 0.84 ROC AUC,并显著提高配对准确率,其中 DeBERTav3Large 表现最佳。除了准确率之外,我们还整合了 SHAP 和 LIME 以提供细粒度的可解释性,揭示模型决策依赖于上下文相关的安全性和支持性框架,而非孤立关键词。我们进一步分析了偏见放大,表明虽然单个特征具有微弱的边际效应,但它们的交互作用影响偏好学习。
引用
@article{arxiv.2604.01312,
title = {Preference learning in shades of gray: Interpretable and bias-aware reward modeling for human preferences},
author = {Simona-Vasilica Oprea and Adela Bâra},
journal= {arXiv preprint arXiv:2604.01312},
year = {2026}
}