Pseudo-Q:为视觉定位生成伪语言查询
计算机视觉与模式识别
2022-11-18 v2 人工智能
计算与语言
摘要
视觉定位,即依据自然语言查询在图像中定位物体,是视觉语言理解中的重要课题。该任务最有效的方案多基于深度学习,通常需耗费人力标注图像-查询或图像块-查询对。为消除对人工标注的严重依赖,我们提出一种名为 Pseudo-Q 的新方法,可自动生成伪语言查询用于监督训练。我们的方法借助现成的目标检测器从未经标注的图像中识别视觉物体,随后通过伪查询生成模块以无监督方式获取这些物体的语言查询。接着,我们设计了一个任务相关的查询提示模块,以使生成的伪语言查询专门适配视觉定位任务。此外,为充分捕捉图像与语言查询间的上下文关系,我们开发了配备多级跨模态注意力机制的视觉-语言模型。大量实验结果表明,我们的方法具有两大显著优势:(1)可大幅降低人工标注成本,例如在 RefCOCO 上降低 31%,且在全监督设定下不损失原模型性能;(2)无需额外技巧,在我们实验的五个数据集上,其性能优于或媲美最先进的(SOTA)弱监督视觉定位方法。代码见 https://github.com/LeapLabTHU/Pseudo-Q。
引用
@article{arxiv.2203.08481,
title = {Pseudo-Q: Generating Pseudo Language Queries for Visual Grounding},
author = {Haojun Jiang and Yuanze Lin and Dongchen Han and Shiji Song and Gao Huang},
journal= {arXiv preprint arXiv:2203.08481},
year = {2022}
}
备注
Accepted by CVPR2022