基于配对亲和力学习的弱监督视频场景图生成
计算机视觉与模式识别
2026-03-24 v1
摘要
弱监督视频场景图生成(WS-VSGG)旨在无需边界框标注、仅依赖稀疏时间标注的情况下,将视频内容解析为结构化关系三元组,从而显著降低标注成本。由于缺乏边界框标注,这些方法依赖离线检测器生成目标提议,但大多数忽略了与完全监督流程之间的根本性差异。完全监督的检测器隐式地过滤掉非交互式目标,而离线检测器对所有可见目标不加区隔地检测,从而使关系模型负担沉重的噪声对。我们通过引入可学习的配对亲和力来估计主体-客体对是否可能发生交互。通过配对亲和力学习与评分(PALS),配对亲和力被纳入推理时排序,并通过配对亲和力调制(PAM)集成到上下文推理中,从而抑制非交互式配对,聚焦于富有意义的关系。为为配对亲和力学习提供更干净的监督,我们进一步提出关系感知匹配(RAM),利用视觉-语言 grounding 解决伪标签生成中的类别层面模糊问题。在 Action Genome 数据集上进行大量实验表明,我们的方法在不同基线和主干网络上均实现显著提升,达到 WS-VSGG 的最新水平。
引用
@article{arxiv.2603.21559,
title = {Revisiting Weakly-Supervised Video Scene Graph Generation via Pair Affinity Learning},
author = {Minseok Kang and Minhyeok Lee and Minjung Kim and Jungho Lee and Donghyeong Kim and Sungmin Woo and Inseok Jeon and Sangyoun Lee},
journal= {arXiv preprint arXiv:2603.21559},
year = {2026}
}
备注
28 pages, 11 figures