计算机视觉模型中用于去除背景偏差的掩蔽策略
计算机视觉与模式识别
2023-08-24 v1 人工智能
机器学习
摘要
在细粒度图像分类任务中,某些类别之间的差异可能极为细微,且每类的样本数量往往较少,这类模型尤其容易习得与背景相关的偏差,并需要鲁棒的方法来处理具有分布外(OOD)背景的潜在样本。为深入理解这一关键问题,我们的研究考察了背景诱导偏差对细粒度图像分类的影响,评估了卷积神经网络(CNN)和视觉Transformer(ViT)等标准骨干模型。我们探索了两种缓解背景诱导偏差的掩蔽策略:早期掩蔽,即在(输入)图像层面去除背景信息;以及晚期掩蔽,即有选择地掩蔽对应于背景的高层空间特征。大量实验评估了CNN和ViT模型在不同掩蔽策略下的行为,重点关注它们对OOD背景的泛化能力。所得结果表明,与基线模型相比,两种提出的策略均提升了OOD性能,其中早期掩蔽始终表现出最佳的OOD性能。值得注意的是,采用基于GAP池化的Patch token分类并结合早期掩蔽的ViT变体实现了最高的OOD鲁棒性。
引用
@article{arxiv.2308.12127,
title = {Masking Strategies for Background Bias Removal in Computer Vision Models},
author = {Ananthu Aniraj and Cassio F. Dantas and Dino Ienco and Diego Marcos},
journal= {arXiv preprint arXiv:2308.12127},
year = {2023}
}
备注
Accepted at the 2023 IEEE/CVF International Conference on Computer Vision Workshop (ICCVW) on Out Of Distribution Generalization in Computer Vision (OOD-CV)