先分类后定位:将视频场景图重构为时序二分图
摘要
当前的视频场景图生成(VidSGG)模型均为基于提议的方法,即它们首先生成大量成对的主语-宾语片段作为提议,然后对每个提议进行谓词分类。本文认为,这种主流的基于提议的框架存在三个固有缺陷:1)提议的真实谓词标签仅部分正确;2)它们破坏了同一主语-宾语对的不同谓词实例之间的高阶关系;3)VidSGG性能受限于提议的质量。为此,我们提出了一种新的先分类后定位的VidSGG框架,该框架能够避免所有这三个被忽视的缺陷。同时,在此框架下,我们将视频场景图重构为时序二分图,其中实体和谓词是两类具有时间槽的节点,边表示这些节点之间不同的语义角色。这种表述充分利用了我们新框架的优势。据此,我们进一步提出了一种新颖的基于二分图的场景图生成模型:BIG。它由一个分类阶段和一个定位阶段组成,前者旨在对所有节点和边的类别进行分类,后者则试图定位每个关系实例的时间位置。在两个VidSGG数据集上的大量消融实验证明了我们框架和BIG模型的有效性。代码可在https://github.com/Dawn-LX/VidSGG-BIG获取。
引用
@article{arxiv.2112.04222,
title = {Classification-Then-Grounding: Reformulating Video Scene Graphs as Temporal Bipartite Graphs},
author = {Kaifeng Gao and Long Chen and Yulei Niu and Jian Shao and Jun Xiao},
journal= {arXiv preprint arXiv:2112.04222},
year = {2022}
}
备注
Accepted by CVPR 2022. Code is available at https://github.com/Dawn-LX/VidSGG-BIG. We also won the 1st place of Video Relation Understanding (VRU) Grand Challenge in ACM Multimedia 2021, with a simplified version of our model.(The code for object tracklets generation is available at https://github.com/Dawn-LX/VidVRD-tracklets)