自监督学习视觉模型中社会偏见的分布研究
计算机视觉与模式识别
2022-03-04 v1
摘要
深度神经网络在数据分布被充分采样时能高效学习数据分布。然而,它们可能被训练数据中隐式包含的非相关因素强烈偏置。这些包括操作性偏见(如无效或不均匀的数据采样),也包括伦理问题,因为社会偏见隐式存在——甚至是无意中存在于训练数据中,或在非公平训练调度中被显式定义。在影响人类过程的任务中,社会偏见的学习可能产生歧视性、不道德和不可信的后果。人们常假设社会偏见源于带标签数据的监督学习,因此自监督学习(SSL)错误地被视为一种高效且无偏的解决方案,因为它不需要标签数据。然而,最近已证明一种流行的 SSL 方法同样包含偏见。本文中,我们使用心理学专家设计用于测量社会偏见的方法和数据集,研究使用 ImageNet 数据训练的一组多样化 SSL 视觉模型的偏见。我们表明 SSL 模型的类型与其包含的偏见数量之间存在相关性。此外,结果还表明该数量并不严格依赖于模型的精度,并在网络中随层变化。最后,我们得出结论:谨慎的 SSL 模型选择过程可在保持高性能的同时减少部署模型中的社会偏见数量。
引用
@article{arxiv.2203.01854,
title = {A study on the distribution of social biases in self-supervised learning visual models},
author = {Kirill Sirotkin and Pablo Carballeira and Marcos Escudero-Viñolo},
journal= {arXiv preprint arXiv:2203.01854},
year = {2022}
}
备注
10 pages, 6 figures, accepted in CVPR2022