中文

关于实现精确公平性的最优引导

机器学习 2025-10-27 v2 人工智能

摘要

为了解决公平机器学习中的“偏见输入,偏见输出”问题,将数据特征分布或大型语言模型(LLM)的内部表示引导至能保证群体公平结果的理想分布至关重要。先前关于公平生成模型和表示引导的工作,若能获得模型输出的可证明公平性保证,将大为受益。我们将满足以下条件的分布定义为理想分布:在其上任何代价敏感风险的最小化器都能保证具有精确的群体公平结果(例如,人口统计平权、机会均等)——换言之,不存在公平性与效用之间的权衡。我们通过在 KL 散度下寻找最近的理想分布来构建最优引导的优化问题,并在底层分布来自已知参数族(例如,正态分布、对数正态分布)时提供了高效算法。在实验中,我们的最优引导技术在合成和真实数据集上均提升了公平性且未降低效用(有时甚至提升了效用)。我们展示了对 LLM 表示的仿射引导,以减少多类分类中的偏差,例如在 Bios 数据集(De-Arteaga et al.)中基于简短传记的职业预测。此外,我们将 LLM 的内部表示引导至期望输出,使其在不同群体间表现同样良好。

关键词

引用

@article{arxiv.2509.15759,
  title  = {On Optimal Steering to Achieve Exact Fairness},
  author = {Mohit Sharma and Amit Jayant Deshpande and Chiranjib Bhattacharyya and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2509.15759},
  year   = {2025}
}

备注

Accepted for Presentation at Neurips 2025