中文

面向视觉 Transformer 的无范例持续学习:关于注意力、函数与权重正则化的考察

计算机视觉与模式识别 2022-05-06 v4 机器学习

摘要

本文中,我们研究视觉 Transformer (ViT) 在具有挑战性的无范例场景下的持续学习,特别关注如何高效蒸馏其关键自注意力机制 (SAM) 的知识。我们的工作朝针对 ViT 设计连贯持续学习方法的 SAM 外科式考察迈出初步一步。我们首先对既有的持续学习正则化技术进行评估。随后,我们考察当正则化应用于 SAM 的两个关键促成因素时的效果:(a) 上下文嵌入层,因其相对于值捕获良好缩放表示的能力;以及 (b) 预缩放注意力图,因其携带与值无关的全局上下文信息。我们在两个图像识别基准 (CIFAR100 与 ImageNet-32) 上描绘了各蒸馏策略的优势——(a) 带来更好的整体精度,(b) 通过保持竞争性表现有助于增强刚性。此外,我们识别出对称正则化损失所施加的局限。为缓解此问题,我们提出一种非对称变体,并将其应用于适配 ViT 的池化输出蒸馏 (POD) 损失。实验证实,为 POD 引入非对称性在 (a) 与 (b) 上提升其可塑性同时保持稳定性。而且,我们观察到所有对比方法的低遗忘度量,表明 ViT 可能是天然倾向的持续学习者。

关键词

引用

@article{arxiv.2203.13167,
  title  = {Towards Exemplar-Free Continual Learning in Vision Transformers: an Account of Attention, Functional and Weight Regularization},
  author = {Francesco Pelosin and Saurav Jha and Andrea Torsello and Bogdan Raducanu and Joost van de Weijer},
  journal= {arXiv preprint arXiv:2203.13167},
  year   = {2022}
}

备注

Accepted at Continual Learning Workshop (CVPR 2022)