从颜色到类别:视觉变换器中概念的涌现
计算机视觉与模式识别
2025-04-01 v1 机器学习
摘要
视觉变换器(ViTs)因其强大的表示能力而日益广泛应用于各种计算机视觉任务。然而,关于ViTs逐层处理信息的方式仍未得到充分研究。大量研究表明,卷积神经网络(CNNs)在各层中提取特征复杂度逐渐增加,这对于诸如域适应和迁移学习等任务至关重要。由于缺乏与CNNs相同的归纳偏置,ViTs可能从第一层开始因其注意力机制而学习全局依赖关系。鉴于ViTs在计算机视觉中的日益重要地位,亟需改进对ViTs层级理解的水平。本文提出了一种新颖的ViTs中编码概念的层级分析方法,通过神经元标记实现。我们的发现表明,ViTs在网络中编码的概念复杂度随层数递增。早期层主要编码基本特征,如颜色和纹理,而后期层则表示更具体的类别,包括物体和动物。随着编码概念的复杂度增加,各层中表示概念的数量也随之增多,反映出更为多样和具体的特征集合。此外,不同的预训练策略会影响编码概念的数量和类别,微调到特定下游任务通常会减少编码概念的数量,并将概念转向更相关的类别。
引用
@article{arxiv.2503.24071,
title = {From Colors to Classes: Emergence of Concepts in Vision Transformers},
author = {Teresa Dorszewski and Lenka Tětková and Robert Jenssen and Lars Kai Hansen and Kristoffer Knutsen Wickstrøm},
journal= {arXiv preprint arXiv:2503.24071},
year = {2025}
}
备注
Preprint. Accepted at The 3rd World Conference on eXplainable Artificial Intelligence