InvPT:用于密集场景理解的倒金字塔多任务 Transformer
计算机视觉与模式识别
2022-11-08 v3
摘要
多任务密集场景理解是一个蓬勃发展的研究领域,需要对一系列具有像素级预测的关联任务进行同时感知与推理。现有大多数工作由于大量使用卷积操作,在局部性建模方面存在严重局限,而在此问题中,在全局空间位置与多任务语境下进行交互学习与推理至关重要。本文提出一种新颖的端到端倒金字塔多任务 Transformer(InvPT),在统一框架中对空间位置与多个任务进行同时建模。据我们所知,这是首个探索设计 Transformer 结构用于场景理解的多任务密集预测的工作。此外,广泛研究表明更高的空间分辨率对密集预测极为有益,但由于大空间尺寸带来的巨大复杂度,现有 Transformer 很难在更高分辨率下加深网络。InvPT 提出一种高效的 UP-Transformer 模块,在逐渐增大的分辨率下学习多任务特征交互,并融合有效的自注意力消息传递与多尺度特征聚合,以高分辨率生成任务特定预测。我们的方法在 NYUD-v2 与 PASCAL-Context 数据集上分别取得了优越的多任务性能,并显著优于以往的 SOTA。代码见 https://github.com/prismformore/InvPT
引用
@article{arxiv.2203.07997,
title = {InvPT: Inverted Pyramid Multi-task Transformer for Dense Scene Understanding},
author = {Hanrong Ye and Dan Xu},
journal= {arXiv preprint arXiv:2203.07997},
year = {2022}
}
备注
Published in ECCV 2022 Conference. Code is available at https://github.com/prismformore/InvPT