聚焦于目标以提升弱监督视觉定位
计算机视觉与模式识别
2023-02-23 v1
摘要
弱监督视觉定位旨在预测图像中与特定语言查询相对应的区域,其中训练阶段目标对象与查询之间的映射未知。当前最优方法使用视觉语言预训练模型从Grad-CAM获取热力图,将每个查询词与图像区域匹配,并利用组合热力图对区域提议进行排序。本文中,我们提出两种简单而高效的方法来改进该方法。首先,我们提出目标感知裁剪方法,以鼓励模型学习对象与场景级别的语义表示。其次,我们应用依存句法分析提取与目标对象相关的词,并在热力图组合中强调这些词。我们的方法在RefCOCO、RefCOCO+和RefCOCOg上以显著优势超越先前SOTA方法。
引用
@article{arxiv.2302.11252,
title = {Focusing On Targets For Improving Weakly Supervised Visual Grounding},
author = {Viet-Quoc Pham and Nao Mishima},
journal= {arXiv preprint arXiv:2302.11252},
year = {2023}
}
备注
accepted by ICASSP2023