基于图像与描述间结构相似性的零样本指代表达理解
计算机视觉与模式识别
2024-04-10 v3
摘要
零样本指代表达理解旨在定位图像中与所给文本提示对应的边界框,这需要:(i)对复杂视觉场景与文本上下文的细粒度解耦,以及(ii)理解解耦后实体间关系的能力。遗憾的是,现有的大型视觉-语言对齐(VLA)模型(如 CLIP)在两方面均存在困难,因而无法直接用于该任务。为弥补此差距,我们利用大型基础模型将图像与文本解耦为 (主语, 谓语, 宾语) 格式的三元组。此后,通过使用 VLA 模型计算视觉与文本三元组间的结构相似性矩阵,并将其传播至实例级相似性矩阵来完成定位。此外,为使 VLA 模型具备关系理解能力,我们设计了一个三元组匹配目标,在包含丰富实体关系的精选数据集上微调 VLA 模型。实验表明,在 RefCOCO/+/g 上,我们的视觉定位性能较 SOTA 零样本模型提升高达 19.5%。在更具挑战性的 Who's Waldo 数据集上,我们的零样本方法取得了与全监督模型相当的精度。代码见 https://github.com/Show-han/Zeroshot_REC。
引用
@article{arxiv.2311.17048,
title = {Zero-shot Referring Expression Comprehension via Structural Similarity Between Images and Captions},
author = {Zeyu Han and Fangrui Zhu and Qianru Lao and Huaizu Jiang},
journal= {arXiv preprint arXiv:2311.17048},
year = {2024}
}
备注
CVPR 2024, Code available at https://github.com/Show-han/Zeroshot_REC