中文

用于通用视觉定位的解耦时空图

计算机视觉与模式识别 2021-03-19 v1

摘要

视觉定位因多样性和复杂性而成为视觉-语言理解中的一个长期问题。当前研究主要集中于在静态图像或经过精细裁剪的视频片段中进行视觉定位。相比之下,本工作研究一种更通用的设定——通用视觉定位(generic visual grounding),旨在挖掘所有满足给定表述的对象,这在真实场景中具有挑战性却更为实用。重要的是,定位结果需要在空间和时间上均准确锁定目标。然而,在外观特征与运动特征之间做出权衡十分棘手。在真实场景中,模型往往难以区分具有相似属性的干扰项。受这些考量驱动,我们提出一种简单而有效的方法,称为 DSTG,致力于:1)解耦空间与时间表征以收集全方位的线索以实现精准定位;2)通过对比学习路由策略增强对干扰项的判别力与时间一致性。我们进一步精心构建了一个新视频数据集 GVG,其包含具有远距离视频的挑战性指称案例。实证实验充分证明了 DSTG 在 Charades-STA、ActivityNet-Caption 和 GVG 数据集上优于最先进方法(SOTA)。代码与数据集将公开。

关键词

引用

@article{arxiv.2103.10191,
  title  = {Decoupled Spatial Temporal Graphs for Generic Visual Grounding},
  author = {Qianyu Feng and Yunchao Wei and Mingming Cheng and Yi Yang},
  journal= {arXiv preprint arXiv:2103.10191},
  year   = {2021}
}