评分末端的偏见
计算机视觉与模式识别
2026-04-16 v1
摘要
奖励模型 (RM) 本质上是非中性的价值函数,旨在编码特定目标,如人类偏好或文本-图像对齐。RM 已成为文本到图像 (T2I) 生成系统的关键组件,广泛用于数据筛选、评估指标、参数优化中的监督信号,以及 T2I 输出的后生成安全与质量过滤。尽管将 RM 集成到 T2I 流程中已有特定问题被研究(如奖励黑客或模式坍缩),但其作为评分函数的鲁棒性与公平性仍大体未知。我们对 RM 在 T2I 模型训练与生成期间针对人口统计偏见的鲁棒性进行了大规模审计。我们提供定量与定性证据表明,尽管最初开发为质量衡量标准,RM 仍编码了人口统计偏见,这导致引导奖励的优化使女性形象主动裸露、强化性别/种族刻板印象,并导致人口统计多样性崩溃。这些发现凸显了当前奖励模型的不足,挑战了其作为质量指标的可靠性,并凸显了改进数据收集与训练程序以实现更鲁棒评分的必要性。
引用
@article{arxiv.2604.13305,
title = {Bias at the End of the Score},
author = {Salma Abdel Magid and Grace Guo and Esin Tureci and Amaya Dharmasiri and Vikram V. Ramaswamy and Hanspeter Pfister and Olga Russakovsky},
journal= {arXiv preprint arXiv:2604.13305},
year = {2026}
}
备注
Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026