无位置信息的场景图生成
计算机视觉与模式识别
2025-01-22 v3
摘要
场景图生成(SGG)是一项视觉理解任务,旨在将场景描述为实体及其相互关系的图。现有工作依赖于以边界框或分割掩码形式给出的位置标签,增加了标注成本并限制了数据集扩展。认识到许多应用并不需要位置数据,我们打破这种依赖并引入无位置信息的场景图生成(LF-SGG)。这一新任务旨在预测实体实例及其关系,而无需显式计算其空间定位。为了客观评估该任务,需要对预测的场景图与真实场景图进行比较。我们通过一种高效的分支算法解决了这一 NP 困难问题。此外,我们设计了首个 LF-SGG 方法 Pix2SG,采用自回归序列建模。我们在三个场景图生成数据集以及两个下游任务(图像检索和视觉问答)上证明了方法的有效性,并表明我们的方法在不依赖位置线索的情况下与现有方法具有竞争力。
引用
@article{arxiv.2303.10944,
title = {Location-Free Scene Graph Generation},
author = {Ege Özsoy and Felix Holm and Mahdi Saleh and Tobias Czempiel and Chantal Pellegrini and Nassir Navab and Benjamin Busam},
journal= {arXiv preprint arXiv:2303.10944},
year = {2025}
}