中文

VLT:用于指代分割的视觉-语言Transformer与查询生成

计算机视觉与模式识别 2022-11-28 v1

摘要

我们提出一种用于指代分割的视觉-语言Transformer(VLT)框架,以促进多模态信息间的深度交互并增强对视觉-语言特征的全局理解。理解语言表述的动态侧重有不同方式,尤其在与图像交互时。然而,现有Transformer工作中的所学查询在训练后固定,无法应对语言表述的随机性与巨大多样性。为此,我们提出查询生成模块,动态生成多组输入特定查询以表征语言表述的多样理解。为在这些多样理解中寻得最佳者以生成更优掩码,我们提出查询平衡模块选择性融合该组查询的相应响应。此外,为增强模型处理多样语言表述的能力,我们考虑样本间学习,显式赋予模型理解同一对象不同语言表述的知识。我们引入掩码对比学习,以缩小同一目标对象不同表述的特征,同时区分不同对象特征。所提方法轻量,并在五个数据集上持续取得新的最先进(state-of-the-art)指代分割结果。

关键词

引用

@article{arxiv.2210.15871,
  title  = {VLT: Vision-Language Transformer and Query Generation for Referring Segmentation},
  author = {Henghui Ding and Chang Liu and Suchen Wang and Xudong Jiang},
  journal= {arXiv preprint arXiv:2210.15871},
  year   = {2022}
}

备注

TPAMI