基于频率引导的场景图生成视频多级推理
计算机视觉与模式识别
2026-04-21 v1
摘要
视频场景图生成旨在获取视频中物体及其关系的结构化语义表示,以实现高层次理解。然而现有方法在处理长尾分布方面仍存在局限。本文提出了 Frequency-guided Relational Multi-level Reasoning(FReMuRe)模型,从机制层面增强对长尾关系的建模能力。我们引入关系特定分支以解决梯度冲突,实现更均衡且对尾部数据敏感的学习。同时设计了频率感知双分支谓词嵌入网络,分别建模高频与低频关系,通过门控融合提升尾部类别的召回率。此外,我们提出两种可互换的关系分类头:贝叶斯头用于不确定性估计,以及新的高斯混合模型头以增强类内多样性。实验结果表明,FReMuRe 在 Action Genome 数据集上显著提升了长尾关系的召回率及整体推理鲁棒性。
引用
@article{arxiv.2604.17298,
title = {Frequency-guided Multi-level Reasoning for Scene Graph Generation in Video},
author = {Chenxing Li and Yiping Duan and Xiaoming Tao},
journal= {arXiv preprint arXiv:2604.17298},
year = {2026}
}
备注
5pages,3figures, 2tables, icassp 2026