中文

基于自适应注意力链接正则化的视觉 Transformer

计算机视觉与模式识别 2022-11-28 v1

摘要

尽管 Transformer 网络近期被应用于各类视觉任务并取得优异性能,但训练模型以摆脱归纳偏置需要大量训练数据与漫长训练时间。我们利用预训练卷积神经网络(CNN)的通道级空间注意力与视觉 Transformer(ViT)注意力头之间的可训练链接,提出一种正则化技术以提升 ViT 的训练效率。这些可训练链接被称为注意力增强模块,其与 ViT 同时训练,促进 ViT 训练并使其避免因数据不足导致的过拟合问题。从训练好的注意力增强模块中,我们可以提取各 CNN 激活图与各 ViT 注意力头之间的相关关系,并基于此进一步提出一种进阶注意力增强模块。因此,即便数据量很少,所提方法仍能显著提升 ViT 性能,同时在训练中实现更快收敛。

关键词

引用

@article{arxiv.2211.13852,
  title  = {Adaptive Attention Link-based Regularization for Vision Transformers},
  author = {Heegon Jin and Jongwon Choi},
  journal= {arXiv preprint arXiv:2211.13852},
  year   = {2022}
}

备注

14 pages, 5 figures