中文

图像分类任务中归纳偏置的研究

计算机视觉与模式识别 2022-11-01 v1

摘要

近来,自注意力(SA)结构在计算机视觉领域流行。它们具有局部独立的滤波器且可使用大核,这与先前流行的卷积神经网络(CNN)相矛盾。CNN 的成功归因于硬编码的局部性与空间不变性归纳偏置。然而,近期研究表明 CNN 中的归纳偏置过于受限。另一方面,类似于深度可分离(DW)卷积的相对位置编码对于局部 SA 网络是必要的,这表明 SA 结构并非完全空间变化的。因此,我们欲确定归纳偏置的哪一部分促成了局部 SA 结构的成功。为此,我们引入了上下文感知分解注意力(CADA),将注意力图分解为多个可训练基核,并使用上下文感知(CA)参数对其进行累加。借此,我们得以识别 CNN 与 SA 网络之间的联系。我们使用应用于 ImageNet 分类任务的 ResNet50 进行了消融研究。与 CNN 相比,DW 卷积可在不增加计算成本的情况下具有大局部性,但精度随核增大而饱和。CADA 遵循此局部性特征。我们表明上下文感知是关键属性;然而,构建 CA 参数并不需要大的局部信息。尽管无空间不变性使训练困难,但更宽松的空间不变性比严格空间不变性给出更好精度。此外,通过相对位置编码引入的额外强空间不变性是更可取的。我们将这些实验扩展到下采样滤波器,表明局部性偏置对下采样更为关键,但可通过宽松空间不变性去除强局部性偏置。

关键词

引用

@article{arxiv.2210.17141,
  title  = {Studying inductive biases in image classification task},
  author = {Nana Arizumi},
  journal= {arXiv preprint arXiv:2210.17141},
  year   = {2022}
}