中文

视觉分类器中的捷径学习易感性研究

机器学习 2025-09-03 v2 计算机视觉与模式识别

摘要

捷径学习是指机器学习模型利用数据中的伪相关性而非捕获有意义的特征,从而在训练期间找到旨在最小化训练损失但在实际数据结构上不稳健的捷径。这一现象在视觉、自然语言处理和语音识别等各种机器学习应用中广泛存在,模型可能会发现意外的线索。基于卷积神经网络(CNN)、多层感知器(MLP)和视觉转换器(ViT)的视觉分类器利用不同的体系结构原理来处理空间和结构信息,从而对捷径学习具有不同的易感性。在本研究中,我们通过在数据集中引入与类别标签相关的positional 和 intensity 捷径,对这些体系结构进行系统评估,创建一个受控环境以评估模型是否依赖这些人工线索或学习实际的区分特征。我们进行了定量评估,通过在包含相同捷径和不包含捷径的两个不同测试集上训练和测试来确定模型对捷径的依赖程度。此外,我们使用基于网络反演的重建技术进行定性评估,以分析模型在其权重中内在的知识,旨在重建训练数据中模型所感知的内容。进一步,我们评估了不同学习率下对捷径学习的易感性。我们的分析表明,较低学习率下的 CNN 倾向于更谨慎,几乎不依赖捷径特征,而 ViT,特别是没有位置编码的 ViT,在捷径存在时几乎完全忽略显著的图像特征。

关键词

引用

@article{arxiv.2502.09150,
  title  = {Shortcut Learning Susceptibility in Vision Classifiers},
  author = {Pirzada Suhail and Vrinda Goel and Amit Sethi},
  journal= {arXiv preprint arXiv:2502.09150},
  year   = {2025}
}