中文

AIM-Fair:通过上下文合成数据选择性微调偏置模型以促进算法公平性

计算机视觉与模式识别 2025-03-10 v1 机器学习

摘要

生成模型的最新进展激发了利用 AI 生成数据改善模型公平性的研究。然而,现有方法在合成数据的多样性和质量方面常面临局限,导致公平性和模型整体准确性受损。此外,许多方法依赖于人口群体标签的可用性,而这些标签的标注成本往往很高。本文提出 AIM-Fair,旨在克服这些局限并利用前沿生成模型在促进算法公平性方面的潜力。我们研究了一种微调范式,从最初在无人口标注的真实世界数据上训练的偏置模型开始。然后使用最先进的扩散模型生成的无偏合成数据对该模型进行微调,以提高其公平性。在这种微调范式中发现了两个关键挑战:1)合成数据质量低下,即使使用先进的生成模型也可能发生;2)真实数据与合成数据之间的领域和偏差差距。为了解决合成数据质量的局限,我们提出了上下文合成数据生成(CSDG),利用具有上下文感知 LLM 生成提示的文本到图像扩散模型(T2I)来生成数据,确保合成数据的数据多样性和偏差控制。为了解决领域和偏差偏移,我们引入了一种新颖的选择性微调方案,其中仅更新对偏差更敏感且对领域偏移较不敏感的模型参数。在 CelebA 和 UTKFace 数据集上的实验表明,我们的 AIM-Fair 在保持效用的同时提高了模型公平性,优于全量微调和部分微调的模型公平性方法。

关键词

引用

@article{arxiv.2503.05665,
  title  = {AIM-Fair: Advancing Algorithmic Fairness via Selectively Fine-Tuning Biased Models with Contextual Synthetic Data},
  author = {Zengqun Zhao and Ziquan Liu and Yu Cao and Shaogang Gong and Ioannis Patras},
  journal= {arXiv preprint arXiv:2503.05665},
  year   = {2025}
}

备注

Accepted at CVPR 2025. Github: https://github.com/zengqunzhao/AIM-Fair. Project page: https://zengqunzhao.github.io/AIMFair