用于可泛化多任务学习的视觉Transformer适配器
计算机视觉与模式识别
2023-08-25 v1 计算与语言
摘要
我们提出了首个可学习可泛化任务亲和力的多任务视觉Transformer适配器,其可应用于新任务与新领域。与现有的参数代价高昂的多任务Transformer不同,我们的适配器集成于现成的视觉Transformer骨干网络中,能够以参数高效的方式同时解决多个密集视觉任务。与同期方法相比,我们在新增任务或领域时无需重新训练或微调。我们在适配器框架内引入了任务自适应注意力机制,将基于梯度的任务相似度与基于注意力的相似度相结合。所学得的任务亲和力可泛化至以下场景:零样本任务迁移、无监督领域自适应,以及无需微调即可泛化至新领域。我们证明,我们的方法不仅优于现有的基于卷积神经网络的多任务方法,也优于基于视觉Transformer的方法。我们的项目页面位于\url{https://ivrl.github.io/VTAGML}。
引用
@article{arxiv.2308.12372,
title = {Vision Transformer Adapters for Generalizable Multitask Learning},
author = {Deblina Bhattacharjee and Sabine Süsstrunk and Mathieu Salzmann},
journal= {arXiv preprint arXiv:2308.12372},
year = {2023}
}
备注
Accepted to ICCV 2023