中文

OV-VG:一种开放词汇视觉定位基准

计算机视觉与模式识别 2023-10-24 v1

摘要

开放词汇学习已成为一个前沿研究领域,尤其是鉴于基于视觉的基础模型被广泛采用。其主要目标是理解未包含于预定义词汇中的新概念。该工作的一个关键方面是视觉定位(Visual Grounding),即根据相应的语言描述在图像中定位特定区域。尽管当前基础模型在各种视觉语言任务上表现出色,但明显缺乏专为开放词汇视觉定位设计的模型。本研究引入了新颖且具挑战性的 OV 任务,即开放词汇视觉定位(Open-Vocabulary Visual Grounding)与开放词汇短语定位(Open-Vocabulary Phrase Localization)。总体目标是建立语言描述与新物体定位之间的联系。为此,我们整理了一个全面的标注基准,包含 7,272 张 OV-VG 图像与 1,000 张 OV-PL 图像。在应对这些挑战的过程中,我们深入探究了基于现有开放词汇目标检测、VG 与短语定位框架的多种基线方法。令人惊讶的是,我们发现 SOTA 方法在多样场景下常常失效。因此,我们开发了一个集成两个关键组件的新框架:文本-图像查询选择(Text-Image Query Selection)与语言引导特征注意力(Language-Guided Feature Attention)。这些模块旨在增强对新类别的识别并改善视觉与语言信息间的对齐。大量实验证明了我们所提框架的有效性,其在 OV-VG 任务上持续取得 SOTA 性能。此外,消融研究进一步证实了我们的创新模型的有效性。代码与数据集将在 https://github.com/cv516Buaa/OV-VG 公开。

关键词

引用

@article{arxiv.2310.14374,
  title  = {OV-VG: A Benchmark for Open-Vocabulary Visual Grounding},
  author = {Chunlei Wang and Wenquan Feng and Xiangtai Li and Guangliang Cheng and Shuchang Lyu and Binghao Liu and Lijiang Chen and Qi Zhao},
  journal= {arXiv preprint arXiv:2310.14374},
  year   = {2023}
}