CLIP模型是一种高效的在线终身学习者
计算机视觉与模式识别
2024-05-27 v1
摘要
在线终身学习(Online Lifelong Learning, OLL)旨在解决从连续且非平稳数据流中学习的挑战。现有的基于图像分类模型的在线终身学习方法常需预设条件,如类别总数或最大内存容量,这会阻碍实现真正的永续学习,并使其在现实场景中难以实用。本文提出,视觉语言模型如对比语言-图像预训练(CLIP)更适合作为在线终身学习的候选对象。我们发现,在进行CLIP模型的在线终身学习中的参数高效微调(Parameter-Efficient Tuning, PET)时,维持图像与文本之间的对称性至关重要。为此,我们引入了对称图像-文本(Symmetric Image-Text, SIT)调优策略。我们在多个终身学习基准数据集上进行了广泛实验,并通过梯度分析阐明了SIT的有效性。此外,我们评估了终身学习对CLIP通用性的影响,发现对图像编码器的调优有助于终身学习,而对文本编码器的调优有助于零样本学习。
引用
@article{arxiv.2405.15155,
title = {CLIP model is an Efficient Online Lifelong Learner},
author = {Leyuan Wang and Liuyu Xiang and Yujie Wei and Yunlong Wang and Zhaofeng He},
journal= {arXiv preprint arXiv:2405.15155},
year = {2024}
}