防止视觉-语言模型持续学习中的零样本迁移退化
计算机视觉与模式识别
2023-08-14 v2 机器学习
摘要
持续学习(CL)可帮助预训练的视觉-语言模型高效适应新的或训练不足的数据分布而无需重新训练。然而,在Contrastive Language-Image Pre-training(CLIP)模型的持续训练过程中,我们观察到由于灾难性遗忘,模型的零样本迁移能力显著退化。现有CL方法可通过回放先前数据来缓解遗忘。但由于CLIP数据集是私有的,回放方法无法访问预训练数据集。此外,回放已学下游任务的数据可提升其性能,但代价是牺牲零样本性能。为应对该挑战,我们提出一种新方法ZSCL,在特征和参数空间中防止视觉-语言模型持续学习中的零样本迁移退化。在特征空间中,引入参考数据集用于当前模型与初始模型之间的蒸馏。该参考数据集应具有语义多样性,但无需标注、无需在预训练中出现或为匹配的图像-文本对。在参数空间中,我们通过训练过程中平均权重来防止大幅参数偏移。我们提出更具挑战性的多领域任务增量学习(MTIL)基准来评估不同方法,其中任务来自不同领域而非单一数据集中的类分离。我们的方法在传统类增量学习设置和MTIL中以9.7%的平均分数优于其他方法。我们的代码位于https://github.com/Thunderbeee/ZSCL。
引用
@article{arxiv.2303.06628,
title = {Preventing Zero-Shot Transfer Degradation in Continual Learning of Vision-Language Models},
author = {Zangwei Zheng and Mingyuan Ma and Kai Wang and Ziheng Qin and Xiangyu Yue and Yang You},
journal= {arXiv preprint arXiv:2303.06628},
year = {2023}
}
备注
Accepted by ICCV 2023