中文

InvPT++:用于视觉场景理解的倒金字塔多任务 Transformer

计算机视觉与模式识别 2023-06-09 v1

摘要

多任务场景理解旨在设计能够用一个通用模型同时预测多个场景理解任务的模型。先前的研究通常以更局部的方式处理多任务特征,因此无法有效学习空间全局和跨任务交互,这阻碍了模型充分利用多任务学习中各任务一致性的能力。为解决此问题,我们提出了一种倒金字塔多任务 Transformer,能够在全局上下文中对不同任务的空间特征进行跨任务交互建模。具体而言,我们首先利用一个 transformer 编码器为所有任务捕获任务通用特征。然后,我们设计一个 transformer 解码器来全局建立空间和跨任务交互,并设计了一种新颖的 UP-Transformer 块以逐步提升多任务特征的分辨率并在不同尺度上建立跨任务交互。此外,提出了两种跨尺度自注意力模块,即融合注意力和选择性注意力,以高效促进不同特征尺度间的跨任务交互。进一步引入了编码器特征聚合策略以更好地在解码器中建模多尺度信息。在多个 2D/3D 多任务基准上的综合实验清楚地证明了我们所提方法的有效性,确立了显著的最先进性能。

关键词

引用

@article{arxiv.2306.04842,
  title  = {InvPT++: Inverted Pyramid Multi-Task Transformer for Visual Scene Understanding},
  author = {Hanrong Ye and Dan Xu},
  journal= {arXiv preprint arXiv:2306.04842},
  year   = {2023}
}

备注

Journal extension for InvPT