DAM:用于持续视频问答学习的动态适配器合并
计算机视觉与模式识别
2024-04-24 v2 人工智能
计算与语言
机器学习
摘要
我们提出了一种用于持续视频问答 (VidQA) 学习的参数高效方法。我们的方法名为 DAM,使用所提出的动态适配器合并 (Dynamic Adapter Merging) 来 (i) 缓解灾难性遗忘,(ii) 实现对持续到达数据集的高效适应,(iii) 处理推理期间来自未知数据集的输入,以及 (iv) 促进相似数据集领域间的知识共享。给定一组持续流式的 VidQA 数据集,我们在冻结大型预训练视频-语言主干参数的同时,为每个数据集顺序训练特定于数据集的适配器。在推理期间,给定来自未知领域的视频-问题样本,我们的方法首先使用所提出的非参数路由器函数计算每个适配器的概率,反映该适配器与当前视频-问题输入实例的相关程度。随后,所提出的动态适配器合并方案将所有适配器权重聚合为针对该特定测试样本定制的新适配器实例,以计算最终的 VidQA 预测,从而减轻不准确路由器预测的影响并促进跨领域知识共享。我们的 DAM 模型在跨越不同领域的 6 个 VidQA 数据集上优于先前 SOTA 持续学习方法 9.1%,同时表现出减少 1.9% 的遗忘。我们进一步将 DAM 扩展到持续图像分类和图像问答,并以大幅优势优于先前方法。代码公开于:https://github.com/klauscc/DAM
引用
@article{arxiv.2403.08755,
title = {DAM: Dynamic Adapter Merging for Continual Video QA Learning},
author = {Feng Cheng and Ziyang Wang and Yi-Lin Sung and Yan-Bo Lin and Mohit Bansal and Gedas Bertasius},
journal= {arXiv preprint arXiv:2403.08755},
year = {2024}
}
备注
The first two authors contribute equally