SDTP:面向密集图像预测的语义感知解耦Transformer金字塔
计算机视觉与模式识别
2021-09-21 v1
摘要
尽管Transformer在计算机视觉任务上已取得巨大进展,但密集图像预测中的尺度变化仍是关键挑战。现有方法在Transformer中很少应用有效的多尺度技术,且存在两个主要局限。一方面,原始Transformer中的自注意力模块因其刚性机制未能充分利用语义信息的多样性。另一方面,由于沉重的计算负担,难以在不同层级间建立注意力与交互。为缓解该问题,我们首先重新审视密集预测中的多尺度问题,验证了多样语义表示与多尺度交互的重要性,并探索了Transformer对金字塔结构的适配。受这些发现的启发,我们提出一种新颖的面向密集图像预测的语义感知解耦Transformer金字塔(SDTP),由层级内语义提升(ISP)、跨层级解耦交互(CDI)和注意力精炼函数(ARF)组成。ISP在不同感受野空间中探索语义多样性。CDI在解耦空间中建立不同层级间的全局注意力与交互,同时也解决了重计算问题。此外,进一步加入ARF以精炼Transformer中的注意力。实验结果证明了所提方法的有效性与通用性,在密集图像预测任务中以显著优势超越SOTA。而且,所提组件均为即插即用,可嵌入其他方法。
引用
@article{arxiv.2109.08963,
title = {SDTP: Semantic-aware Decoupled Transformer Pyramid for Dense Image Prediction},
author = {Zekun Li and Yufan Liu and Bing Li and Weiming Hu and Kebin Wu and Pei Wang},
journal= {arXiv preprint arXiv:2109.08963},
year = {2021}
}