野外皮肤色分类的大规模数据集与基准
计算机视觉与模式识别
2026-03-04 v1 机器学习
摘要
深度学习模型常常从其训练数据中继承偏见。虽然性别和种族的公平性已受到良好研究,但细粒度皮肤色分析仍然面临缺乏粗粒度、标注数据集的挑战。现有方法常依赖医学6色Fitzpatrick尺度,缺乏视觉代表性,或使用小型私有数据集导致不可复现,或常依赖经典计算机视觉流程,少数使用深度学习。它们忽视了如车厢-漂泊和数据集不平衡等问题,受限于小型或不可用的数据集。本文提出了全面的皮肤色公平性框架。首先,我们引入STW数据集,包含42,313张来自3,564名个体的图像,使用10色MST尺度进行标注。其次,我们对经典计算机视觉(SkinToneCCV)和深度学习方法进行基准测试,表明经典模型提供近随机结果,而深度学习接近标注者准确率。最后,我们提出SkinToneNet,一种针对ViT进行微调的模型,在域外数据上实现最高的泛化精度,从而可靠地公平性审计公共数据集如CelebA和VGGFace2。本工作在皮肤色分类和公平性评估方面达到最新成果。代码和数据即将公开。
引用
@article{arxiv.2603.02475,
title = {Large-Scale Dataset and Benchmark for Skin Tone Classification in the Wild},
author = {Vitor Pereira Matias and Márcus Vinícius Lobo Costa and João Batista Neto and Tiago Novello de Brito},
journal= {arXiv preprint arXiv:2603.02475},
year = {2026}
}
备注
12 pages, 11 figures