D3Former:用于增量学习的去偏双蒸馏Transformer
计算机视觉与模式识别
2023-06-06 v3 机器学习
摘要
在类增量学习(CIL)设定中,每一学习阶段都会向模型引入若干组类别。其目标是学习一个在所有已观测类别上均表现良好的统一模型。鉴于视觉Transformer(ViT)在传统分类任务中近年来的流行,一个有趣的问题是研究它们的持续学习行为。本工作中,我们提出了一种用于CIL的去偏双蒸馏Transformer,称为。所提模型利用混合嵌套ViT设计,以确保数据效率并可扩展至小规模与大规模数据集。与近期一种基于ViT的CIL方法不同,我们的在学习新任务时不会动态扩展其架构,并适用于大量增量任务。改善的CIL行为源于对ViT设计的两项根本性改动。首先,我们将增量学习视为长尾分类问题,其中来自新类的多数样本数量远超可用于旧类的有限 exemplar(样本范例)。为避免对少数旧类的偏置,我们提出动态调节logits以强调保留与旧任务相关的表示。其次,我们提出随着跨任务学习的推进保持空间注意力图的配置。这有助于通过约束模型保留对最具判别性区域的注意力来减轻灾难性遗忘。在CIFAR-100、MNIST、SVHN和ImageNet数据集的增量版本上取得了优异结果。代码见 https://tinyurl.com/d3former
引用
@article{arxiv.2208.00777,
title = {D3Former: Debiased Dual Distilled Transformer for Incremental Learning},
author = {Abdelrahman Mohamed and Rushali Grandhe and K J Joseph and Salman Khan and Fahad Khan},
journal= {arXiv preprint arXiv:2208.00777},
year = {2023}
}
备注
Accepted to CLVision at CVPR 2023