中文

聚焦于目标以提升弱监督视觉定位

计算机视觉与模式识别 2023-02-23 v1

摘要

弱监督视觉定位旨在预测图像中与特定语言查询相对应的区域,其中训练阶段目标对象与查询之间的映射未知。当前最优方法使用视觉语言预训练模型从Grad-CAM获取热力图,将每个查询词与图像区域匹配,并利用组合热力图对区域提议进行排序。本文中,我们提出两种简单而高效的方法来改进该方法。首先,我们提出目标感知裁剪方法,以鼓励模型学习对象与场景级别的语义表示。其次,我们应用依存句法分析提取与目标对象相关的词,并在热力图组合中强调这些词。我们的方法在RefCOCO、RefCOCO+和RefCOCOg上以显著优势超越先前SOTA方法。

关键词

引用

@article{arxiv.2302.11252,
  title  = {Focusing On Targets For Improving Weakly Supervised Visual Grounding},
  author = {Viet-Quoc Pham and Nao Mishima},
  journal= {arXiv preprint arXiv:2302.11252},
  year   = {2023}
}

备注

accepted by ICASSP2023