视觉数据集中偏差问题综述
计算机视觉与模式识别
2022-06-24 v2
摘要
计算机视觉(CV)已取得显著成果,在若干任务上超越人类。然而,若处理不当,可能引发显著歧视,因为 CV 系统高度依赖其所输入的数据,并可能学习并放大这些数据中的偏差。因此,理解与发现偏差的问题至关重要。然而,目前尚无关于视觉数据集中偏差的全面综述。故此,本工作旨在:i)描述视觉数据集中可能显现的偏差;ii)回顾视觉数据集中偏差发现与量化方法的文献;iii)讨论收集偏差感知视觉数据集的现有尝试。我们研究的一个关键结论是,视觉数据集中偏差发现与量化问题仍属开放问题,无论在方法还是可处理的偏差范围上均有改进空间。此外,不存在无偏差的数据集,因此科学家与从业者必须意识到其数据集中的偏差并予以明示。为此,我们提出一份在视觉数据集收集过程中识别不同类型偏差的检查清单。
引用
@article{arxiv.2107.07919,
title = {A Survey on Bias in Visual Datasets},
author = {Simone Fabbrizzi and Symeon Papadopoulos and Eirini Ntoutsi and Ioannis Kompatsiaris},
journal= {arXiv preprint arXiv:2107.07919},
year = {2022}
}