用于持续视觉-语言预训练的生成式负文本回放
计算机视觉与模式识别
2022-11-01 v1
摘要
视觉-语言预训练(VLP)近来受到越来越多的关注。借助大量图文对,采用对比损失训练的VLP模型在各种任务上取得了令人印象深刻的性能,尤其是在下游数据集上的零样本泛化能力。然而,在实际应用中,海量数据通常以流式方式收集,要求VLP模型持续整合来自新数据的知识并保留已学知识。本工作中,我们专注于使用顺序分块的图文对数据学习VLP模型。为应对这一多模态持续学习设定中的灾难性遗忘问题,我们首先引入伪文本回放,其基于记忆中的训练图像生成困难负文本,不仅更好地保留已学知识,还提升了对比损失中负样本的多样性。此外,我们提出图像与文本间的多模态知识蒸馏,以对齐新旧模型的实例级预测。我们在Conceptual Caption数据集的实例增量与类增量划分上逐步预训练模型,并在零样本图像分类与图文检索任务上评估模型。我们的方法以较大优势持续优于现有基线,证明了其优越性。值得注意的是,在类增量划分上,我们在图像分类下游数据集上实现了平均 的性能提升。
引用
@article{arxiv.2210.17322,
title = {Generative Negative Text Replay for Continual Vision-Language Pretraining},
author = {Shipeng Yan and Lanqing Hong and Hang Xu and Jianhua Han and Tinne Tuytelaars and Zhenguo Li and Xuming He},
journal= {arXiv preprint arXiv:2210.17322},
year = {2022}
}
备注
ECCV 2022