中文

利用块混合将 ViT 块选择性硬连接入 CNN

计算机视觉与模式识别 2023-07-03 v1

摘要

视觉Transformer(ViT)已显著改变计算机视觉格局,并周期性地在视觉任务中展现出优于卷积神经网络(CNN)的性能。尽管何种模型更优尚无定论,但二者均具有独特的归纳偏置,塑造其学习与泛化表现。例如,ViT 在早期层非局部特征依赖方面具有有趣特性,且自注意力机制增强了学习灵活性,使其能更有效地忽略脱离上下文的图像信息。我们假设这种忽略脱离上下文信息(我们称之为 块选择性\textit{块选择性})的能力,同时在早期层以非局部方式整合上下文信息,使 ViT 能更轻松地处理遮挡。在本研究中,我们旨在探明能否通过块混合数据增强有效硬连接此归纳偏置,使 CNN 模拟该块选择性能力;块混合即将另一图像的补丁插入训练图像并在两图像类别间插值标签。具体而言,我们使用块混合训练最先进的 ViT 和 CNN,评估其对忽略脱离上下文补丁及处理自然遮挡能力的影响。我们发现 ViT 经块混合训练后既无提升也无退化,而 CNN 获得了忽略脱离上下文信息的新能力并在遮挡基准上改进,由此得出结论:该训练方法是 CNN 模拟 ViT 已有能力的一种途径。我们将发布块混合实现与所提数据集供公开使用。项目页:https://arielnlee.github.io/PatchMixing/

关键词

引用

@article{arxiv.2306.17848,
  title  = {Hardwiring ViT Patch Selectivity into CNNs using Patch Mixing},
  author = {Ariel N. Lee and Sarah Adel Bargal and Janavi Kasera and Stan Sclaroff and Kate Saenko and Nataniel Ruiz},
  journal= {arXiv preprint arXiv:2306.17848},
  year   = {2023}
}