通过众包图像块标注提取人类注意力
计算机视觉与模式识别
2024-03-25 v1 人机交互
摘要
在图像分类中,数据集偏差是一个显著问题。当数据集仅包含特定类型的图像时,分类器开始依赖捷径——用于决策的简单且错误的规则。这导致在训练数据集上性能很高,但在新的、多样化的图像上结果较差,因为分类器的泛化能力降低了。例如,如果标记为胡须的图像仅由男性人物组成,模型可能会无意中学会按性别而非胡须的存在与否进行分类。减轻此类偏差的一种方法是引导模型注意力到目标对象的位置,通常使用边界框或多边形进行标注。然而,收集此类标注需要大量时间和人力。因此,我们提出一种新颖的图像块标注方法,将人工智能辅助与众包相结合,从图像中捕获人类注意力,可作为减轻偏差的可行方案。我们的方法包含两个步骤。首先,我们使用预训练的显著性检测模型提取目标的近似位置,并辅以人工验证以确保准确性。然后,我们通过迭代地将图像分割成更小的图像块,并利用众包确定每个图像块是否可被分类为目标对象,来确定图像中的人类注意力区域。我们通过提高分类准确率和模型关注的精细化程度,证明了该方法在减轻偏差方面的有效性。此外,众包实验验证了我们的方法收集人类标注的速度比用多边形标注对象位置快达3.4倍,显著减少了对人力资源的需求。我们在论文结尾讨论了该方法在众包环境中的优势,主要关注人为错误和可及性方面。
引用
@article{arxiv.2403.15013,
title = {Extracting Human Attention through Crowdsourced Patch Labeling},
author = {Minsuk Chang and Seokhyeon Park and Hyeon Jeon and Aeri Cho and Soohyun Lee and Jinwook Seo},
journal= {arXiv preprint arXiv:2403.15013},
year = {2024}
}
备注
21 pages, 11 figures