中文

InvPT:用于密集场景理解的倒金字塔多任务 Transformer

计算机视觉与模式识别 2022-11-08 v3

摘要

多任务密集场景理解是一个蓬勃发展的研究领域,需要对一系列具有像素级预测的关联任务进行同时感知与推理。现有大多数工作由于大量使用卷积操作,在局部性建模方面存在严重局限,而在此问题中,在全局空间位置与多任务语境下进行交互学习与推理至关重要。本文提出一种新颖的端到端倒金字塔多任务 Transformer(InvPT),在统一框架中对空间位置与多个任务进行同时建模。据我们所知,这是首个探索设计 Transformer 结构用于场景理解的多任务密集预测的工作。此外,广泛研究表明更高的空间分辨率对密集预测极为有益,但由于大空间尺寸带来的巨大复杂度,现有 Transformer 很难在更高分辨率下加深网络。InvPT 提出一种高效的 UP-Transformer 模块,在逐渐增大的分辨率下学习多任务特征交互,并融合有效的自注意力消息传递与多尺度特征聚合,以高分辨率生成任务特定预测。我们的方法在 NYUD-v2 与 PASCAL-Context 数据集上分别取得了优越的多任务性能,并显著优于以往的 SOTA。代码见 https://github.com/prismformore/InvPT

关键词

引用

@article{arxiv.2203.07997,
  title  = {InvPT: Inverted Pyramid Multi-task Transformer for Dense Scene Understanding},
  author = {Hanrong Ye and Dan Xu},
  journal= {arXiv preprint arXiv:2203.07997},
  year   = {2022}
}

备注

Published in ECCV 2022 Conference. Code is available at https://github.com/prismformore/InvPT