中文

FairPO:面向公平多标签学习的鲁棒偏好优化

机器学习 2025-12-01 v4 人工智能

摘要

多标签分类 (MLC) 常常面临标签间性能差异的问题。我们提出了 \textbf{FairPO},一个结合了基于偏好的损失和组鲁棒优化的框架,通过针对表现不佳的标签来提升公平性。FairPO 将标签划分为一个用于针对性改进的“特权”集和一个用于维持基线性能的“非特权”集。对于特权标签,一个受 DPO 启发的偏好损失通过纠正真实标签与其混淆对应标签之间的排序错误来处理困难样本。一个约束目标维持非特权标签的性能,而组鲁棒偏好优化 (GRPO) 公式则自适应地平衡这两个目标以减轻偏差。我们还通过使用对比 (CPO) 和简单 (SimPO) 偏好优化的无参考变体,展示了 FairPO 的通用性。

关键词

引用

@article{arxiv.2505.02433,
  title  = {FairPO: Robust Preference Optimization for Fair Multi-Label Learning},
  author = {Soumen Kumar Mondal and Prateek Chanda and Akshit Varmora and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2505.02433},
  year   = {2025}
}