面向视频场景图生成的目标自适应上下文聚合
计算机视觉与模式识别
2021-08-19 v1
摘要
本文处理一项具挑战性的视频场景图生成(Video Scene Graph Generation, VidSGG)任务,其可作为面向高层理解任务的结构化视频表示。我们为该任务提出一种新的{\em 检测至跟踪}范式,通过将关系预测的上下文建模与复杂的底层实体跟踪解耦。具体而言,我们设计了一种高效的帧级VidSGG方法,称为{\em 目标自适应上下文聚合网络}(Target Adaptive Context Aggregation Network, TRACE),侧重于捕获用于关系识别的时空上下文信息。我们的TRACE框架以模块化设计精简了VidSGG流程,并提出了层次关系树(Hierarchical Relation Tree, HRTree)构建与目标自适应上下文聚合两个独特模块。更具体地,我们的HRTree首先提供一种自适应结构以高效组织可能的关系候选,并引导上下文聚合模块有效捕获时空结构信息。随后,我们为每个关系候选获得上下文特征表示,并构建分类头以识别其关系类别。最后,我们提供一种简单的时间关联策略来跟踪TRACE检测结果以产生视频级VidSGG。我们在两个VidSGG基准:ImageNet-VidVRD与Action Genome上进行了实验,结果表明我们的TRACE取得了最先进(state-of-the-art)性能。代码与模型见 \url{https://github.com/MCG-NJU/TRACE}。
引用
@article{arxiv.2108.08121,
title = {Target Adaptive Context Aggregation for Video Scene Graph Generation},
author = {Yao Teng and Limin Wang and Zhifeng Li and Gangshan Wu},
journal= {arXiv preprint arXiv:2108.08121},
year = {2021}
}
备注
ICCV 2021 camera-ready version