诊断与缓解偏好模型中的片面偏见:讨态、浮华与雾霾
计算与语言
2026-03-05 v3
摘要
语言模型作为人类偏好判断的代理在对齐和评估中发挥着重要作用,但它们表现出系统性的失准,优先考虑浅层特征而非实质性特征。这种偏见表现为对长度、结构和风格等特征的过度依赖,导致奖励黑客和不可靠评估等问题。然而,训练数据中的偏见与模型所呈现的失准偏好之间的联系仍未得到充分理解。在本工作中,我们系统性地调查了训练数据偏见与偏好模型失准之间的关系,涵盖语言模型生成的五种片面特征:长度、结构、术语、讨态和模糊。我们首先通过受控的反事实对照对进行分析,量化偏好模型对人为放大偏见(skew)响应的偏好程度,发现此类偏好在超过 60% 的情况下都存在,模型的偏好相对于人类偏好显示出高水平的失准(约 40%)。值得注意的是,偏见特征仅与人类偏好标签呈现轻度负相关(平均 ),但与来自强大奖励模型的标签呈中等强度正相关(平均 ),表明模型可能过度依赖虚假线索。为缓解这些问题,我们提出一种基于反事实数据增强(CDA)的简单微调方法,使用合成的对比示例。通过 CDA 微调的模型,平均失准从 39.4% 降至 32.5%,平均绝对 skew 差异从 20.5% 降至 10.0%,同时保持整体 RewardBench 性能,表明有针对性的去偏可以强化标准对齐管道中偏好模型的可靠性。
引用
@article{arxiv.2506.05339,
title = {Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models},
author = {Anirudh Bharadwaj and Chaitanya Malaviya and Nitish Joshi and Mark Yatskar},
journal= {arXiv preprint arXiv:2506.05339},
year = {2026}
}
备注
Published at ICLR 2026; Code and data available at https://github.com/anirudhb123/preference-model-biases