生成式多模态模型是优秀的类增量学习器
计算机视觉与模式识别
2024-03-28 v1 人工智能
机器学习
摘要
在类增量学习(CIL)场景中,由分类器偏向当前任务导致的灾难性遗忘现象长期以来一直是一个重大挑战。这主要由判别式模型的特性引起。随着生成式多模态模型的日益普及,我们将探索用生成式模型替代判别式模型用于 CIL。然而,从判别式模型向生成式模型过渡需要解决两个关键挑战。主要挑战在于将生成的文本信息转化为对不同类别的分类。此外,还需要在生成式框架内表述 CIL 任务。为此,我们提出了一种用于类增量学习的新型生成式多模态模型(GMM)框架。我们的方法使用适配后的生成式模型直接为图像生成标签。在获得详细文本后,我们使用文本编码器提取文本特征,并采用特征匹配来确定最相似的标签作为分类预测。在常规 CIL 设置中,我们在长序列任务场景中取得了显著更好的结果。在 Few-shot CIL 设置下,与所有当前 SOTA 方法相比,我们的准确率至少提高了 14%,且遗忘显著减少。我们的代码可在 \url{https://github.com/DoubleClass/GMM} 获取。
引用
@article{arxiv.2403.18383,
title = {Generative Multi-modal Models are Good Class-Incremental Learners},
author = {Xusheng Cao and Haori Lu and Linlan Huang and Xialei Liu and Ming-Ming Cheng},
journal= {arXiv preprint arXiv:2403.18383},
year = {2024}
}
备注
Accepted at CVPR 2024