中文

掩码自解码器是高效的多任务视觉通用模型

计算机视觉与模式识别 2024-03-18 v2

摘要

受 NLP 中通用模型成功的启发,最近的研究试图以相同的序列格式统一不同的视觉任务,并采用自回归 Transformer 进行序列预测。它们应用单向注意力来捕获序列依赖关系并递归地生成任务序列。然而,这种自回归 Transformer 可能并不适合视觉任务,因为视觉任务序列通常缺乏自然语言中典型的序列依赖关系。在本工作中,我们设计了掩码自解码器 (Masked AutoDecoder, MAD),一种高效的多任务视觉通用模型。MAD 包含两个核心设计。首先,我们开发了一个并行解码框架,引入双向注意力以全面捕获上下文依赖关系,并并行解码视觉任务序列。其次,我们设计了一种掩码序列建模方法,通过掩码和重建任务序列来学习丰富的任务上下文。这样,MAD 通过单个网络分支和简单的交叉熵损失即可处理所有任务,且仅需极少的任务特定设计。大量实验证明了 MAD 作为统一各种视觉任务的新范式的巨大潜力。与自回归对应模型相比,MAD 实现了更优的性能和推理效率,同时获得了与任务特定模型相媲美的准确率。代码将发布。

关键词

引用

@article{arxiv.2403.07692,
  title  = {Masked AutoDecoder is Effective Multi-Task Vision Generalist},
  author = {Han Qiu and Jiaxing Huang and Peng Gao and Lewei Lu and Xiaoqin Zhang and Shijian Lu},
  journal= {arXiv preprint arXiv:2403.07692},
  year   = {2024}
}

备注

Accepted by CVPR 2024