ReLIC-SGG:用于开放词汇场景图生成的关系晶格完成
计算机视觉与模式识别
2026-05-27 v6
摘要
开放词汇场景图生成(SGG)旨在描述超出固定谓词集合的灵活关系短语的视觉场景。现有方法通常将标注的三元组视为正样本,将所有未标注的对象-关系对视为负样本。然而,场景图注释本身不完整:许多有效关系缺失,同一相互作用可在不同粒度下描述,例如 \textit{on}、\textit{standing on}、\textit{resting on} 和 \textit{supported by}。在开放词汇 SGG 中,这一问题因关系空间的扩大而更为严重。我们提出 \textbf{ReLIC-SGG},一种关系不完整感知框架,将未标注关系视为潜在变量而非确定的负样本。ReLIC-SGG 构建语义关系晶格,以建模开放词汇谓词之间的相似性、蕴含和矛盾,并利用视觉-语言兼容性、图上下文和语义一致性推断缺失的正向关系。进一步地,正-未标记图学习目标减少误判的负向监督,晶格引导的解码产生紧凑且语义一致的场景图。在常规、开放词汇和全景 SGG 数据集上实验表明,ReLIC-SGG 提升了稀有和未见谓词的识别能力,并更好地恢复了缺失的关系。
引用
@article{arxiv.2604.22546,
title = {ReLIC-SGG: Relation Lattice Completion for Open-Vocabulary Scene Graph Generation},
author = {Amir Hosseini and Sara Farahani and Xinyi Li and Suiyang Guang},
journal= {arXiv preprint arXiv:2604.22546},
year = {2026}
}
备注
Some errors in the experimental sections