自监督学习可提高模型公平性
机器学习
2024-06-05 v1
摘要
自监督学习(SSL)已成为大型模型事实上的训练范式,其中预训练后跟随使用特定领域数据和标签的监督式微调。尽管表现出与监督方法相当的性能,但缺乏对SSL对机器学习公平性(即在不同人口统计划分上表现均等)影响的全面评估。我们假设SSL模型会学习更通用、因此更不偏见的表征。本研究探讨了预训练和微调策略对公平性的影响。我们引入了一个用于SSL的公平性评估框架,包括五个阶段:定义数据集要求、预训练、逐步解冻微调、在人口统计条件下评估表征相似性,以及建立特定领域的评估流程。我们在三个真实的人类中心数据集(即MIMIC、MESA和GLOBEM)上评估了该方法的可推广性,通过系统性比较数百种SSL和微调模型在多个维度上进行各种考察,从中间表征到合适的评估指标。我们的发现表明,SSL可以显著提高模型公平性,同时保持与监督方法相当的性能——通过自监督学习,在公平性上可提高最高30%,而性能损失最小。我们认为,这些差异可归因于模型中不同人口统计组在最佳模型与最差模型之间的表征差异——受保护属性中表现差异较大的段落,其差异可高达13倍。
引用
@article{arxiv.2406.02361,
title = {Using Self-supervised Learning Can Improve Model Fairness},
author = {Sofia Yfantidou and Dimitris Spathis and Marios Constantinides and Athena Vakali and Daniele Quercia and Fahim Kawsar},
journal= {arXiv preprint arXiv:2406.02361},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2401.01640