Referring Transformer:一种多任务视觉定位的一步法
计算机视觉与模式识别
2021-07-15 v2
摘要
作为迈向视觉推理的重要一步,视觉定位(如短语定位、指代表达理解/分割)已被广泛探索。以往的指代表达理解(REC)或分割(RES)方法要么因两阶段设置而性能受限,要么需要设计复杂的任务专用单阶段架构。本文提出一种用于视觉定位任务的简单单阶段多任务框架。具体而言,我们利用transformer架构,在视觉-语言编码器中融合两种模态。在解码器中,模型学习生成上下文化的语言查询,随后被解码并用于直接回归边界框及生成对应指代区域的分割掩码。凭借这一简单但高度上下文化的模型,我们在REC与RES任务上均以较大优势超越SOTA方法。我们还表明,在外部数据集上的简单预训练方案可进一步提升性能。大量实验与消融研究说明,我们的模型极大受益于上下文信息及多任务训练。
引用
@article{arxiv.2106.03089,
title = {Referring Transformer: A One-step Approach to Multi-task Visual Grounding},
author = {Muchen Li and Leonid Sigal},
journal= {arXiv preprint arXiv:2106.03089},
year = {2021}
}