中文

SceneProp:融合神经网络与马尔可夫随机场的场景图 grounding 方法

计算机视觉与模式识别 2025-12-02 v1

摘要

对复杂、组合化的视觉查询进行 grounding 是视觉语言模型面临的根本挑战,这类查询包含多个对象和关系。虽然标准的短语 grounding 方法在局部单个对象方面表现优异,但缺乏解析复杂关系描述的结构归纳偏置,往往在查询变得更具描述性时失败。为解决这一结构缺失问题,我们关注场景图 grounding(scene-graph grounding)——即查询是对象及其关系的显式图构成的 formulation。然而,现有方法也表现不佳,恰恰在查询图扩大时性能下降——未能利用本应使 grounding 更容易的关键信息。我们引入 SceneProp,一种新方法通过将场景图 grounding 重新表述为马尔可夫随机场(MRF)中的最大后验概率(MAP)推断问题来解决这一问题。SceneProp 对整个查询图进行全局推断,找到图像区域到节点之间的最优分配,使所有约束同时满足。通过可微实现的信念传播算法,在端到端框架中实现。实验在四个基准数据集上表明,SceneProp 专注于场景图 grounding 的 formulation 使其显著超越先前工作。关键的是,其准确率随查询图的规模和复杂度而持续提高,首次展示更丰富的关系上下文确实可以且应该导致更好的 grounding。代码已公开于 https://github.com/keitaotani/SceneProp。

关键词

引用

@article{arxiv.2512.00936,
  title  = {SceneProp: Combining Neural Network and Markov Random Field for Scene-Graph Grounding},
  author = {Keita Otani and Tatsuya Harada},
  journal= {arXiv preprint arXiv:2512.00936},
  year   = {2025}
}

备注

Accepted to WACV 2026