评估自监督与监督模型在序列数据上的公平性
机器学习
2024-01-04 v1 计算机与社会
摘要
自监督学习(SSL)已成为大模型事实上的训练范式,即先进行预训练,再使用特定领域的数据和标签进行监督微调。本研究假设SSL模型会学习到更通用、因而偏差更小的表示,探索了预训练和微调策略对公平性(即在不同人口统计分组上表现均等)的影响。受现实世界时间序列数据上以人为中心的应用启发,我们通过系统比较SSL模型与其监督对应模型,在模型、层和度量层面解释了归纳偏置。我们的发现表明,SSL有能力达到与监督方法相当的性能,同时显著提升公平性——通过自监督,公平性提升高达27%,而性能仅损失1%。最终,这项工作强调了SSL在以人为中心的计算中的潜力,特别是在如医疗保健等高风险、数据稀缺的应用领域。
引用
@article{arxiv.2401.01640,
title = {Evaluating Fairness in Self-supervised and Supervised Models for Sequential Data},
author = {Sofia Yfantidou and Dimitris Spathis and Marios Constantinides and Athena Vakali and Daniele Quercia and Fahim Kawsar},
journal= {arXiv preprint arXiv:2401.01640},
year = {2024}
}
备注
Paper accepted in Human-Centric Representation Learning workshop at AAAI 2024 (https://hcrl-workshop.github.io/2024/)