一种用于视频中复杂活动检测的混合图网络
计算机视觉与模式识别
2023-10-31 v2
摘要
视频的解析与理解在众多领域(如自动驾驶和体育分析)中是一项具有挑战性的计算机视觉任务。现有的解析视频片段中发生动作的方法基于时间动作定位(TAL),通常识别短期动作。新兴的复杂活动检测(CompAD)领域将此类分析扩展至长期活动,通过对视频中发生的复杂活动的内部结构建模获得更深理解。我们使用一种混合图神经网络来解决 CompAD 问题,该网络将对编码局部(短期)动态场景的图施加注意力与建模整体长时活动的时序图相结合。我们的方法如下:i)首先,我们提出一种新颖的特征提取技术,该技术对每个视频片段,通过检测个体对象、对其进行跟踪,然后从所有智能体管及整体场景中提取 3D 特征,为(局部)场景中的活跃元素(「智能体」)生成时空「管」。ii)接下来,我们构建局部场景图,其中每个节点(代表智能体管或场景)与所有其他节点相连。然后对该图施加注意力以获得局部动态场景的整体表示。iii)最后,所有局部场景图表示通过时序图相互连接,以估计复杂活动类别及其开始和结束时间。所提框架在 ActivityNet-1.3、Thumos-14 和 ROAD 三个数据集上均优于以往所有最先进方法。
引用
@article{arxiv.2310.17493,
title = {A Hybrid Graph Network for Complex Activity Detection in Video},
author = {Salman Khan and Izzeddin Teeti and Andrew Bradley and Mohamed Elhoseiny and Fabio Cuzzolin},
journal= {arXiv preprint arXiv:2310.17493},
year = {2023}
}
备注
This paper is Accepted at WACV 2024