中文

MulT:一种端到端多任务学习Transformer

计算机视觉与模式识别 2022-05-18 v1

摘要

我们提出了一种端到端的多任务学习Transformer框架,名为MulT,用于同时学习多个高层视觉任务,包括深度估计、语义分割、重新着色、表面法线估计、2D关键点检测和边缘检测。基于Swin Transformer模型,我们的框架将输入图像编码为共享表示,并使用特定于任务的基于Transformer的解码头为每个视觉任务进行预测。我们方法的核心是一个共享注意力机制,用于建模任务间的依赖关系。我们在多个多任务基准上评估了我们的模型,结果表明我们的MulT框架优于最先进的多任务卷积神经网络模型以及所有相应的单任务Transformer模型。我们的实验进一步突显了在所有任务间共享注意力的好处,并证明我们的MulT模型具有鲁棒性,并能很好地泛化到新领域。我们的项目网站是 https://ivrl.github.io/MulT/。

关键词

引用

@article{arxiv.2205.08303,
  title  = {MulT: An End-to-End Multitask Learning Transformer},
  author = {Deblina Bhattacharjee and Tong Zhang and Sabine Süsstrunk and Mathieu Salzmann},
  journal= {arXiv preprint arXiv:2205.08303},
  year   = {2022}
}

备注

Accepted to CVPR 2022