SPADE:用于开放词汇场景图生成的空间感知去噪网络,考虑长程与局部范围上下文推理
计算机视觉与模式识别
2025-07-09 v1
摘要
场景图生成(PSG)将实例分割与关系理解集成,以捕捉复杂场景中像素级结构关系。虽然最近利用预训练视觉语言模型(VLMs)的方法在开放词汇设置下显著提高了性能,但这些方法通常忽视了VLMs在空间关系推理方面的固有局限性,例如难以区分物体的相对位置,从而导致关系预测次优。鼓舞于扩散模型在保持输入图像空间结构方面的反向过程,我们提出了SPADE(SPatial-Aware Denoising-nEtwork)框架——一种用于开放词汇PSG的新方法。SPADE包含两个关键步骤:(1) inversion引导的UNet适配校准,以及(2)空间感知上下文推理。在第一步骤中,我们通过轻量级LoRA-based微调策略,从反演过程中推导出的交叉注意力图校准一个通用预训练教师扩散模型以适应PSG的去噪网络。在第二步骤中,我们开发了空间感知关系图变换器,捕获局部和长程上下文信息,以促进高质量关系查询的生成。在PSG和Visual Genome数据集上进行的大量实验表明,SPADE在封闭和开放集场景中均优于最先进的方法,尤其是在空间关系预测方面表现突出。
引用
@article{arxiv.2507.05798,
title = {SPADE: Spatial-Aware Denoising Network for Open-vocabulary Panoptic Scene Graph Generation with Long- and Local-range Context Reasoning},
author = {Xin Hu and Ke Qin and Guiduo Duan and Ming Li and Yuan-Fang Li and Tao He},
journal= {arXiv preprint arXiv:2507.05798},
year = {2025}
}
备注
Accepted to ICCV 2025