基于视觉-语言真/假验证的零样本指代表达理解
计算机视觉与模式识别
2025-11-14 v3 人工智能
摘要
指代表达理解(REC)通常由任务训练的定位模型处理。我们表明,一个无需任何 REC 特定训练的零样本工作流,可以实现具有竞争力或更优的性能。我们的方法将 REC 重新表述为逐框的视觉-语言验证:给定来自 COCO-clean 通用检测器(YOLO-World)的候选框,一个通用视觉语言模型(VLM)独立地对每个区域回答真/假查询。这一简单过程减少了跨框干扰,支持弃权和多重匹配,且无需微调。在 RefCOCO、RefCOCO+ 和 RefCOCOg 上,我们的方法不仅超越了零样本 GroundingDINO 基线,还超过了在 REC 上训练的 GroundingDINO 和 GroundingDINO+CRG 的报告结果。使用相同候选框的对照研究证实,验证显著优于基于选择的提示,并且该结果在使用开源 VLM 时依然成立。总体而言,我们表明工作流设计而非任务特定的预训练,驱动了强大的零样本 REC 性能。
引用
@article{arxiv.2509.09958,
title = {Zero-Shot Referring Expression Comprehension via Vison-Language True/False Verification},
author = {Jeffrey Liu and Rongbin Hu},
journal= {arXiv preprint arXiv:2509.09958},
year = {2025}
}