中文

公平感知奖励优化

机器学习 2026-02-10 v1 人工智能

摘要

人类偏好数据中的人口统计偏差会通过奖励模型传递到对齐的大语言模型中,导致系统性不公平。我们引入 Fairness Aware Reward Optimization(Faro),一个针对奖励模型训练的 in-processing 框架,该框架在实现人口统计公平性、平等机会或反事实公平性约束下进行训练。我们提供了对奖励层面公平性的首个理论分析,确立:(i)为 Faro 训练的奖励模型提供可控松弛的可证明公平性证书;(ii)对 KL 正则化微调所引发的准确性-公平性权衡进行正式特征描述,证明公平性从奖励传递到策略;以及(iii)证明非空的 Pareto 前沿的存在。与预处理和后处理方法不同,Faro 确保奖励模型同时满足有序性(正确排序)、基数性(校准)和公平性。在多个大语言模型和基准测试中,Faro显著减少偏见和有害生成,同时保持或提高模型质量。

关键词

引用

@article{arxiv.2602.07799,
  title  = {Fairness Aware Reward Optimization},
  author = {Ching Lam Choi and Vighnesh Subramaniam and Phillip Isola and Antonio Torralba and Stefanie Jegelka},
  journal= {arXiv preprint arXiv:2602.07799},
  year   = {2026}
}