基于自适应注意力链接正则化的视觉 Transformer
计算机视觉与模式识别
2022-11-28 v1
摘要
尽管 Transformer 网络近期被应用于各类视觉任务并取得优异性能,但训练模型以摆脱归纳偏置需要大量训练数据与漫长训练时间。我们利用预训练卷积神经网络(CNN)的通道级空间注意力与视觉 Transformer(ViT)注意力头之间的可训练链接,提出一种正则化技术以提升 ViT 的训练效率。这些可训练链接被称为注意力增强模块,其与 ViT 同时训练,促进 ViT 训练并使其避免因数据不足导致的过拟合问题。从训练好的注意力增强模块中,我们可以提取各 CNN 激活图与各 ViT 注意力头之间的相关关系,并基于此进一步提出一种进阶注意力增强模块。因此,即便数据量很少,所提方法仍能显著提升 ViT 性能,同时在训练中实现更快收敛。
引用
@article{arxiv.2211.13852,
title = {Adaptive Attention Link-based Regularization for Vision Transformers},
author = {Heegon Jin and Jongwon Choi},
journal= {arXiv preprint arXiv:2211.13852},
year = {2022}
}
备注
14 pages, 5 figures