TSP-Transformer:面向整体场景理解的任务特定提示增强型 Transformer
计算机视觉与模式识别
2023-11-08 v1
摘要
整体场景理解包括语义分割、表面法线估计、物体边界检测、深度估计等。该问题的关键在于有效学习表征,因为每个子任务不仅依赖于相关属性,也依赖于各自独特的属性。受视觉提示微调启发,我们提出一种用于整体场景理解的任务特定提示 Transformer,称为 TSP-Transformer。其特点是在早期阶段使用普通 transformer,在侧向阶段使用任务特定提示 transformer 编码器,其中任务特定提示得到增强。通过这种方式,transformer 层从共享部分学习通用信息,并被赋予任务特定能力。首先,任务特定提示作为各任务的有效归纳先验。此外,任务特定提示可视为开关,以促进不同任务的任务特定表征学习。在 NYUD-v2 和 PASCAL-Context 上的大量实验表明,我们的方法达到了最先进的性能,验证了我们方法在整体场景理解上的有效性。我们也在以下链接提供了代码:https://github.com/tb2-sy/TSP-Transformer。
引用
@article{arxiv.2311.03427,
title = {TSP-Transformer: Task-Specific Prompts Boosted Transformer for Holistic Scene Understanding},
author = {Shuo Wang and Jing Li and Zibo Zhao and Dongze Lian and Binbin Huang and Xiaomei Wang and Zhengxin Li and Shenghua Gao},
journal= {arXiv preprint arXiv:2311.03427},
year = {2023}
}
备注
WACV 2024