在视觉Transformer中保持局部性以用于类增量学习
机器学习
2023-04-17 v1 计算机视觉与模式识别
摘要
在不遗忘的前提下学习新类别,对于分类模型的真实世界应用至关重要。视觉Transformer(ViT)近期在类增量学习(CIL)中取得了显著性能。先前工作主要关注ViT的模块设计与模型扩展。然而,在本文中,我们发现当ViT被增量训练时,注意力层逐渐丧失对局部特征的专注。我们将这一有趣现象称为ViT在CIL中的局部性退化。由于底层局部信息对表征的可迁移性至关重要,保持注意力层中的局部性是有益的。在本文中,我们鼓励模型随着训练过程保留更多局部信息,并设计了一种局部性保持注意力(LPA)层以强调局部特征的重要性。具体而言,我们将局部信息直接融入原始注意力,并通过以小初始值加权原始注意力来控制其初始梯度。大量实验表明,由LPA促进的表征捕获了更多易于迁移到后续任务的底层通用信息。改进后的模型在CIFAR100和ImageNet100上取得了持续更优的性能。
引用
@article{arxiv.2304.06971,
title = {Preserving Locality in Vision Transformers for Class Incremental Learning},
author = {Bowen Zheng and Da-Wei Zhou and Han-Jia Ye and De-Chuan Zhan},
journal= {arXiv preprint arXiv:2304.06971},
year = {2023}
}