VLT:用于指代分割的视觉-语言Transformer与查询生成
计算机视觉与模式识别
2022-11-28 v1
摘要
我们提出一种用于指代分割的视觉-语言Transformer(VLT)框架,以促进多模态信息间的深度交互并增强对视觉-语言特征的全局理解。理解语言表述的动态侧重有不同方式,尤其在与图像交互时。然而,现有Transformer工作中的所学查询在训练后固定,无法应对语言表述的随机性与巨大多样性。为此,我们提出查询生成模块,动态生成多组输入特定查询以表征语言表述的多样理解。为在这些多样理解中寻得最佳者以生成更优掩码,我们提出查询平衡模块选择性融合该组查询的相应响应。此外,为增强模型处理多样语言表述的能力,我们考虑样本间学习,显式赋予模型理解同一对象不同语言表述的知识。我们引入掩码对比学习,以缩小同一目标对象不同表述的特征,同时区分不同对象特征。所提方法轻量,并在五个数据集上持续取得新的最先进(state-of-the-art)指代分割结果。
引用
@article{arxiv.2210.15871,
title = {VLT: Vision-Language Transformer and Query Generation for Referring Segmentation},
author = {Henghui Ding and Chang Liu and Suchen Wang and Xudong Jiang},
journal= {arXiv preprint arXiv:2210.15871},
year = {2022}
}
备注
TPAMI