中文

通用场景图生成

计算机视觉与模式识别 2025-03-20 v1

摘要

场景图表示可以简洁高效地描述场景语义,这推动了场景图生成领域的持续深入研究。在现实世界中,多种模态常常共存,具有不同类型,如图像、文本、视频和 3D 数据,表达不同的特征。不幸的是,当前的场景图研究在很大程度上局限于单模态场景建模,阻碍了充分利用不同模态场景表示在描绘整体场景语义方面的互补优势。为此,我们引入了通用场景图 USG,这是一种能够完全表征来自任意模态输入组合的综合语义场景的新型表示,涵盖了模态不变和模态特定场景。此外,我们量身定制了针对特定领域的 USG 解析器 USG-Par,有效解决了跨模态对象对齐和跨域挑战两个关键瓶颈。我们以模块化架构设计了 USG-Par,用于端到端通用场景图生成,其中我们设计了一个对象关联器来缓解跨模态对象对齐的模态差距。此外,我们提出了一种以文本为中心的场景对比学习机制,通过将多模态对象和关系与文本场景图对齐来缓解域不平衡。通过大量实验,我们证明了 USG 比独立场景图具有更强的场景语义表达能力,并且我们的 USG-Par 实现了更高的效率和性能。

关键词

引用

@article{arxiv.2503.15005,
  title  = {Universal Scene Graph Generation},
  author = {Shengqiong Wu and Hao Fei and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2503.15005},
  year   = {2025}
}

备注

CVPR 2025