DeMT:面向密集预测多任务学习的可变形混合 Transformer
计算机视觉与模式识别
2023-03-07 v3 人工智能
摘要
卷积神经网络(CNN)与 Transformer 各有优势,且均已广泛用于多任务学习(MTL)中的密集预测。当前大多数 MTL 研究仅依赖 CNN 或 Transformer。本工作中,我们提出一种新颖的 MTL 模型,结合可变形 CNN 与基于查询的 Transformer 两者优势用于密集预测的多任务学习。我们的方法名为 DeMT,基于一种简单而有效的编码器-解码器架构(即可变形混合编码器与任务感知 Transformer 解码器)。首先,可变形混合编码器包含两类算子:通道感知混合算子用于实现不同通道间通信( 高效通道位置混合),以及应用可变形卷积的空间感知可变形算子以高效采样更具信息的空间位置(即变形特征)。其次,任务感知 Transformer 解码器由任务交互块与任务查询块组成。前者通过自注意力捕获任务交互特征;后者利用变形特征与任务交互特征,通过基于查询的 Transformer 生成相应任务特定特征以进行对应任务预测。在 NYUD-v2 与 PASCAL-Context 两个密集图像预测数据集上的大量实验表明,我们的模型使用更少 GFLOPs,且在多项指标上显著优于当前基于 Transformer 与 CNN 的竞争性模型。代码见 https://github.com/yangyangxu0/DeMT 。
引用
@article{arxiv.2301.03461,
title = {DeMT: Deformable Mixer Transformer for Multi-Task Learning of Dense Prediction},
author = {Yangyang Xu and Yibo Yang and Lefei Zhang},
journal= {arXiv preprint arXiv:2301.03461},
year = {2023}
}
备注
Accepted by AAAI2023