中文

用于指代分割的视觉-语言Transformer与查询生成

计算机视觉与模式识别 2021-08-13 v1

摘要

在这项工作中,我们解决具有挑战性的指代分割任务。指代分割中的查询表达通常通过描述目标对象与其他对象的关系来指示目标对象。因此,要在图像中的所有实例中找到目标,模型必须对整幅图像有整体理解。为此,我们将指代分割重新表述为一个直接的注意力问题:寻找图像中查询语言表达式注意力最强的区域。我们引入 transformer 与多头注意力来构建具有编码器-解码器注意力机制架构的网络,该网络用语言表达式“查询”给定图像。此外,我们提出一个查询生成模块(Query Generation Module),它生成多组具有不同注意力权重的查询,这些查询代表了从多方面对语言表达式的多样化理解。同时,为了基于视觉线索从这些多样化理解中找到最佳方式,我们进一步提出查询平衡模块(Query Balance Module)来自适应地选择这些查询的输出特征以更好地生成掩码。无需额外技巧,我们的方法轻量且在三个指代分割数据集 RefCOCO、RefCOCO+ 和 G-Ref 上持续取得新的最先进(state-of-the-art)性能。我们的代码见 https://github.com/henghuiding/Vision-Language-Transformer。

关键词

引用

@article{arxiv.2108.05565,
  title  = {Vision-Language Transformer and Query Generation for Referring Segmentation},
  author = {Henghui Ding and Chang Liu and Suchen Wang and Xudong Jiang},
  journal= {arXiv preprint arXiv:2108.05565},
  year   = {2021}
}

备注

ICCV 2021