用于复杂活动检测的时空可变形场景图
计算机视觉与模式识别
2022-11-01 v2 机器学习
摘要
长期复杂活动的识别与定位对于智能汽车和手术机器人等自主系统中的决策至关重要。本文通过一种新颖的可变形时空场景图方法来解决该问题,其包含三个主要模块:(i)动作管检测,(ii)部件可变形几何建模,以及(iii)图卷积网络。首先,在一系列片段中检测动作管。接着,设计一种新的 3D 可变形 RoI 池化层,用于学习组成动作管的灵活可变形几何。最后,通过将所有部件视为节点,并基于出现顺序、共享相同动作标签和特征相似度等不同语义将它们连接,构建场景图。我们还为最近发布的 ROAD 自动驾驶数据集和 SARAS-ESAD 手术动作数据集提供了全新的时序复杂活动标注,并展示了我们的框架对不同领域的适应性。结果表明,我们的方法在这两个增强数据集上显著优于基于图的竞争对手。
引用
@article{arxiv.2104.08194,
title = {Spatiotemporal Deformable Scene Graphs for Complex Activity Detection},
author = {Salman Khan and Fabio Cuzzolin},
journal= {arXiv preprint arXiv:2104.08194},
year = {2022}
}
备注
This paper is published at BMVC 2021