中文

基于频率引导的场景图生成视频多级推理

计算机视觉与模式识别 2026-04-21 v1

摘要

视频场景图生成旨在获取视频中物体及其关系的结构化语义表示,以实现高层次理解。然而现有方法在处理长尾分布方面仍存在局限。本文提出了 Frequency-guided Relational Multi-level Reasoning(FReMuRe)模型,从机制层面增强对长尾关系的建模能力。我们引入关系特定分支以解决梯度冲突,实现更均衡且对尾部数据敏感的学习。同时设计了频率感知双分支谓词嵌入网络,分别建模高频与低频关系,通过门控融合提升尾部类别的召回率。此外,我们提出两种可互换的关系分类头:贝叶斯头用于不确定性估计,以及新的高斯混合模型头以增强类内多样性。实验结果表明,FReMuRe 在 Action Genome 数据集上显著提升了长尾关系的召回率及整体推理鲁棒性。

关键词

引用

@article{arxiv.2604.17298,
  title  = {Frequency-guided Multi-level Reasoning for Scene Graph Generation in Video},
  author = {Chenxing Li and Yiping Duan and Xiaoming Tao},
  journal= {arXiv preprint arXiv:2604.17298},
  year   = {2026}
}

备注

5pages,3figures, 2tables, icassp 2026