CAGE-SGG:基于反事实主动图证据的开放词汇场景图生成
摘要
开放词汇场景图生成(SGG)旨在描述超越固定谓词词汇表的灵活且细粒度的关系短语。虽然近期视觉语言模型大幅扩展了SGG的语义覆盖范围,但也引入了一个关键可靠性问题:预测的关系可能由语言先验或对象共现驱动,而非受视觉证据支配。本文提出一种基于反事实关系验证的证据圆形开放词汇SGG框架。该方法不直接接受合情的关系提案,而是验证每个候选关系是否受特定于关系的视觉、几何和上下文证据支配。具体而言,我们首先使用视觉语言提议器生成开放词汇关系候选,然后将谓词短语分解为支持、接触、包含、深度和状态等软证据基。关系条件证据编码器提取与谓词相关的线索,而反事实验证器测试在必要证据被移除且在无关扰动下保持稳定时,关系得分是否下降。我们进一步引入矛盾感知的谓词学习和图层级偏好优化,以提高细粒度区分度和全局图一致性。实验在常规、开放词汇和全景SGG基准测试上表明,我们的方法在标准召回率指标、未见谓词泛化和反事实 grounding 质量方面均实现了一致性提升。这些结果表明,从关系生成转向关系验证,导致更可靠、可解释且基于证据的场景图。
引用
@article{arxiv.2604.22274,
title = {CAGE-SGG: Counterfactual Active Graph Evidence for Open-Vocabulary Scene Graph Generation},
author = {Suiyang Guang and Chenyu Liu and Ruohan Zhang and Siyuan Chen},
journal= {arXiv preprint arXiv:2604.22274},
year = {2026}
}
备注
This manuscript has been withdrawn by the authors because we found a methodological flaw in the formulation and evaluation of the proposed approach. The issue affects the reliability of the experimental results and the conclusions drawn from them. Therefore, the authors consider the current version unsuitable for citation or further use