CLiMB:面向视觉与语言任务的持续学习基准
计算与语言
2022-11-28 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
当前最先进的视觉与语言模型要么在单个任务上进行评估,要么在多任务设置下进行评估,忽视了任务陆续到来时持续学习(CL)所面临的挑战。现有的CL基准促进了任务适应和缓解“灾难性遗忘”的研究,但仅限于纯视觉和纯语言任务。我们提出了CLiMB,一个用于研究在CL设置下学习多模态任务挑战的基准,并系统评估上游持续学习如何能快速泛化到新的多模态和单模态任务。CLiMB包含多种CL算法的实现,以及一个修改后的视觉-语言Transformer(ViLT)模型,该模型可部署于多模态和单模态任务。我们发现,常见的CL方法有助于减轻多模态任务学习过程中的遗忘,但并不能实现跨任务的知识迁移。我们设想CLiMB将促进针对这一具有挑战性的多模态场景的新型CL算法研究。
引用
@article{arxiv.2206.09059,
title = {CLiMB: A Continual Learning Benchmark for Vision-and-Language Tasks},
author = {Tejas Srinivasan and Ting-Yun Chang and Leticia Leonor Pinto Alva and Georgios Chochlakis and Mohammad Rostami and Jesse Thomason},
journal= {arXiv preprint arXiv:2206.09059},
year = {2022}
}
备注
Accepted to NeurIPS 2022 Datasets and Benchmarks track