基石模型中数据高效泛化是否加剧偏差?
计算机视觉与模式识别
2024-09-04 v2 机器学习
摘要
基石模型在各领域展现出具有标签效率的鲁健性。在医学影像领域,这些模型由于难以获取标记数据而推动了医学诊断的进步。然而,是否使用大量无标签数据(这些数据因预训练期间敏感属性的存在而受偏差影响)会影响模型的公平性尚不清楚。本研究检验了基石模型 (RetFound) 在应用于细调谐巴西多标签眼科数据集 (BRSET) 时是否存在偏差——该数据集的人口与预训练数据集不同于。模型评估结果显示,与监督学习相比,基石模型有潜力缩小不同性别和年龄组中最大 AUC 与最小 AUC 评估之间的差距。然而,在数据高效泛化情况下,该模型会在数据量减小时加剧偏差。这些发现表明,在数据有限的实际场景中部署基石模型时,应考虑公平性问题的可能性。
引用
@article{arxiv.2408.16154,
title = {Does Data-Efficient Generalization Exacerbate Bias in Foundation Models?},
author = {Dilermando Queiroz and Anderson Carlos and Maíra Fatoretto and Luis Filipe Nakayama and André Anjos and Lilian Berton},
journal= {arXiv preprint arXiv:2408.16154},
year = {2024}
}
备注
Preprint of paper to be presented at Fairness and Ethics Towards Transparent AI: Facing the Challenge through Model Debiasing (FAILED) during ECCV 2024