ResVG: 提升多实例场景下关系与语义理解的视觉定位模型
计算机视觉与模式识别
2024-08-30 v1
摘要
视觉定位旨在基于自然语言查询在图像中局部化被提及的对象。尽管近期取得了一些进展,但准确地在包含多个干扰对象(即与目标同类的多个对象)的图像中定位目标对象仍然是一个重要挑战。现有方法在图像中存在多个干扰时性能会显著下降,这表明对目标对象之间细粒度语义和空间关系的理解不足。在本文中,我们提出了一种新方法,即关系和语义敏感的视觉定位(ResVG)模型,以解决此问题。首先,我们通过注入源自文本查询的语义先验信息来增强模型对细粒度语义的理解。这通过利用文本到图像生成模型产生表示查询中描述目标对象语义属性的图像来实现。其次,我们通过引入关系敏感的数据增强方法来解决训练样本中缺乏包含多个干扰对象的情形。该方法通过合成包含多个相同类别对象和基于其空间关系的伪查询的图像来生成额外的训练数据。所提出的 ResVG 模型显著增强了模型对对象语义和空间关系的理解能力,导致在视觉定位任务中获得更好的性能,尤其是在包含多个实例干扰的场景中。我们在五个数据集上进行了大量实验,以验证我们方法的有效性。代码可在 https://github.com/minghangz/ResVG 获取。
引用
@article{arxiv.2408.16314,
title = {ResVG: Enhancing Relation and Semantic Understanding in Multiple Instances for Visual Grounding},
author = {Minghang Zheng and Jiahua Zhang and Qingchao Chen and Yuxin Peng and Yang Liu},
journal= {arXiv preprint arXiv:2408.16314},
year = {2024}
}
备注
Accepted by ACM MM 2024