中文

基于查询驱动场景图的可解释零样本指代表达理解

计算机视觉与模式识别 2026-03-27 v1 多媒体

摘要

零样本指代表达理解(REC)旨在无需依赖任务特定训练数据即可定位图像中的目标对象,要求强大的视觉理解能力。现有视觉语言模型(VLM),如 CLIP,常通过直接衡量文本查询与图像区域之间的特征相似性来实现零样本 REC,但这些方法难以捕获细粒度视觉细节和理解复杂对象关系。与此同时,大语言模型(LLM)在高层语义推理方面表现突出,但其无法直接将视觉特征抽象为文本语义,限制了其在 REC 任务中的应用。为克服上述局限,本文提出一种基于查询驱动场景图作为结构化中介的可解释零样本 REC 方法(SGREC)。具体而言,首先利用 VLM 构建查询驱动场景图,显式编码与给定查询相关的空间关系、描述性说明和对象交互。通过该场景图,我们搭建了低层图像区域与高层语义理解之间的鸿沟。最后,LLM 从场景图提供的结构化文本表示中推断目标对象,并提供详细的决策解释,确保推理过程的可解释性。大量实验表明,SGREC 在大多数零样本 REC 基准测试中实现了最高的 Top-1 准确率,包括 RefCOCO val(66.78%)、RefCOCO+ testB(53.43%)和 RefCOCOg val(73.28%),凸显其强大的视觉场景理解能力。

关键词

引用

@article{arxiv.2603.25004,
  title  = {Interpretable Zero-shot Referring Expression Comprehension with Query-driven Scene Graphs},
  author = {Yike Wu and Necva Bolucu and Stephen Wan and Dadong Wang and Jiahao Xia and Jian Zhang},
  journal= {arXiv preprint arXiv:2603.25004},
  year   = {2026}
}

备注

Accepted by T-MM