中文

面向 ViT 骨干持续学习的 Meta-attention

计算机视觉与模式识别 2022-03-23 v1 人工智能

摘要

由于持续学习在处理持续到达的任务中起着至关重要的作用,它一直是一个长期的研究课题。到目前为止,计算机视觉中持续学习的研究主要局限于卷积神经网络 (CNNs)。然而,最近有一种趋势是新兴的 vision transformers (ViTs) 正在逐渐主导计算机视觉领域,这使得基于 CNN 的持续学习落在后面,因为如果直接应用于 ViTs,它们可能会遭受严重的性能下降。在本文中,我们研究基于 ViT 的持续学习,以借助 ViTs 的最新进展来追求更高的性能。受 CNN 中基于掩码的持续学习方法的启发(其中为每个任务学习一个掩码以使预训练的 ViT 适应新任务),我们提出了 MEta-ATtention (MEAT),即对自注意力的注意力,以在不牺牲已学任务性能的情况下使预训练的 ViT 适应新任务。与 Piggyback 等先前的基于掩码的方法(其中所有参数都关联有相应的掩码)不同,MEAT 利用了 ViTs 的特性,仅对其部分参数进行掩码。这使得 MEAT 具有更高的效率和有效性,且开销更小,准确率更高。大量实验表明,MEAT 相比于 state-of-the-art 的 CNN 对应方法展现出显著优越性,准确率绝对提升 4.0~6.0%。我们的代码已在 https://github.com/zju-vipa/MEAT-TIL 发布。

关键词

引用

@article{arxiv.2203.11684,
  title  = {Meta-attention for ViT-backed Continual Learning},
  author = {Mengqi Xue and Haofei Zhang and Jie Song and Mingli Song},
  journal= {arXiv preprint arXiv:2203.11684},
  year   = {2022}
}

备注

Accepted by CVPR 2022