中文

在视觉Transformer中保持局部性以用于类增量学习

机器学习 2023-04-17 v1 计算机视觉与模式识别

摘要

在不遗忘的前提下学习新类别,对于分类模型的真实世界应用至关重要。视觉Transformer(ViT)近期在类增量学习(CIL)中取得了显著性能。先前工作主要关注ViT的模块设计与模型扩展。然而,在本文中,我们发现当ViT被增量训练时,注意力层逐渐丧失对局部特征的专注。我们将这一有趣现象称为ViT在CIL中的局部性退化。由于底层局部信息对表征的可迁移性至关重要,保持注意力层中的局部性是有益的。在本文中,我们鼓励模型随着训练过程保留更多局部信息,并设计了一种局部性保持注意力(LPA)层以强调局部特征的重要性。具体而言,我们将局部信息直接融入原始注意力,并通过以小初始值加权原始注意力来控制其初始梯度。大量实验表明,由LPA促进的表征捕获了更多易于迁移到后续任务的底层通用信息。改进后的模型在CIFAR100和ImageNet100上取得了持续更优的性能。

关键词

引用

@article{arxiv.2304.06971,
  title  = {Preserving Locality in Vision Transformers for Class Incremental Learning},
  author = {Bowen Zheng and Da-Wei Zhou and Han-Jia Ye and De-Chuan Zhan},
  journal= {arXiv preprint arXiv:2304.06971},
  year   = {2023}
}