中文

Referring Transformer:一种多任务视觉定位的一步法

计算机视觉与模式识别 2021-07-15 v2

摘要

作为迈向视觉推理的重要一步,视觉定位(如短语定位、指代表达理解/分割)已被广泛探索。以往的指代表达理解(REC)或分割(RES)方法要么因两阶段设置而性能受限,要么需要设计复杂的任务专用单阶段架构。本文提出一种用于视觉定位任务的简单单阶段多任务框架。具体而言,我们利用transformer架构,在视觉-语言编码器中融合两种模态。在解码器中,模型学习生成上下文化的语言查询,随后被解码并用于直接回归边界框及生成对应指代区域的分割掩码。凭借这一简单但高度上下文化的模型,我们在REC与RES任务上均以较大优势超越SOTA方法。我们还表明,在外部数据集上的简单预训练方案可进一步提升性能。大量实验与消融研究说明,我们的模型极大受益于上下文信息及多任务训练。

关键词

引用

@article{arxiv.2106.03089,
  title  = {Referring Transformer: A One-step Approach to Multi-task Visual Grounding},
  author = {Muchen Li and Leonid Sigal},
  journal= {arXiv preprint arXiv:2106.03089},
  year   = {2021}
}