VMT-Adapter:用于多任务密集场景理解的参数高效迁移学习
计算机视觉与模式识别
2023-12-18 v2
摘要
大规模预训练模型在各种计算机视觉任务中取得了显著成功。利用这些模型的一种标准方法是针对下游任务微调所有模型参数,这在计算和存储成本方面带来了挑战。最近,受自然语言处理 (NLP) 启发,参数高效迁移学习已成功应用于视觉任务。然而,现有的多数技术主要关注单任务适配,尽管关于多任务适配的研究有限,这些方法通常在训练和推理效率上表现出次优状态。在本文中,我们首先提出了一种一次成型视觉多任务适配器 (VMT-Adapter),它在任务数量上实现了近似 O(1) 的训练和推理效率。具体而言,VMT-Adapter 共享来自多个任务的知识以增强跨任务交互,同时通过独立的知识提取模块保留特定任务的知识。值得注意的是,由于特定任务模块需要很少的参数,VMT-Adapter 可以处理任意数量的任务,而可训练参数的增加微乎其微。我们还提出了 VMT-Adapter-Lite,它通过学习下投影和上投影之间的共享参数,进一步减少了可训练参数。在四个密集场景理解任务上的大量实验证明了 VMT-Adapter(-Lite) 的优越性,与单任务全微调相比实现了 3.96%(1.34%) 的相对提升,同时仅使用了预训练模型约 1% (0.36%) 的可训练参数。
引用
@article{arxiv.2312.08733,
title = {VMT-Adapter: Parameter-Efficient Transfer Learning for Multi-Task Dense Scene Understanding},
author = {Yi Xin and Junlong Du and Qiang Wang and Zhiwen Lin and Ke Yan},
journal= {arXiv preprint arXiv:2312.08733},
year = {2023}
}
备注
Accepted to AAAI2024