通过自洽解释改进视觉定位
计算机视觉与模式识别
2023-12-08 v1 计算与语言
机器学习
摘要
经过训练以匹配图像与文本的视觉-语言模型可以与视觉解释方法相结合,以指向图像中特定物体的位置。我们的工作表明,通过针对自洽视觉解释进行微调,可以进一步提升这些模型的定位(即“定位”)能力。我们提出了一种利用大型语言模型通过释义来增强现有文本-图像数据集的策略,以及 SelfEQ,这是一种在释义的视觉解释图上鼓励自洽性的弱监督策略。具体来说,对于输入的文本短语,我们尝试生成一个释义,并微调模型,使得该短语和释义映射到图像中的同一区域。我们认为,这既扩展了模型能够处理的词汇量,又提高了基于梯度的视觉解释方法(例如 GradCAM)所突出显示的物体位置的质量。我们证明,SelfEQ 在 Flickr30k、ReferIt 和 RefCOCO+ 数据集上,相较于强大的基线方法和多项先前工作,均提升了性能。特别是,与其他不使用任何类型边界框标注的方法相比,我们在 Flickr30k 上达到了 84.07%(绝对提升 4.69%),在 ReferIt 上达到了 67.40%(绝对提升 7.68%),在 RefCOCO+ 测试集 A 和 B 上分别达到了 75.10% 和 55.49%(平均绝对提升 3.74%)。
引用
@article{arxiv.2312.04554,
title = {Improved Visual Grounding through Self-Consistent Explanations},
author = {Ruozhen He and Paola Cascante-Bonilla and Ziyan Yang and Alexander C. Berg and Vicente Ordonez},
journal= {arXiv preprint arXiv:2312.04554},
year = {2023}
}
备注
Project Page: https://catherine-r-he.github.io/SelfEQ/