针对视觉 Transformer 分类器中位置偏置的自适应学习
计算机视觉与模式识别
2025-05-20 v1
摘要
图像分类中位置信息的判别性取决于数据。在一方面,摄像机位置是任意的,对象可以在图像中随意出现,这支持平移不变性。另一方面,位置信息对于利用捕获/中心偏置、场景布局至关重要,例如天空总是在上方。我们表明,位置偏置——数据集在输入特征位置信息使用上的易解程度——在视觉 Transformer 图像分类器性能中起关键作用。为此,我们提出 Position-SHAP,一种通过扩展 SHAP 使其与位置嵌入兼容的直接位置偏置度量方法。我们展示了不同数据集中的各种位置偏置水平,发现最佳位置嵌入选择取决于数据集显露的偏置程度。因此,我们提出 Auto-PE,即一种单参数位置嵌入扩展,使位置嵌入可调节其范数,从而实现位置信息的“遗忘”。Auto-PE 可与现有位置嵌入组合,匹配或提升分类数据集的准确率。
引用
@article{arxiv.2505.13137,
title = {Learning to Adapt to Position Bias in Vision Transformer Classifiers},
author = {Robert-Jan Bruintjes and Jan van Gemert},
journal= {arXiv preprint arXiv:2505.13137},
year = {2025}
}