一种用于视频动作检测的语法组合模型
计算机视觉与模式识别
2023-10-05 v1
摘要
视频中人体动作的分析需要理解复杂的人体动态以及演员与上下文之间的交互。然而,这些交互关系通常因多样的人体姿态或物体操作而表现出较大的类内差异,并在相似动作间存在细粒度的类间区别。因此,现有方法的性能受到严重限制。受交互动作可分解为演员动态与参与物体或人物的观察启发,我们提出研究它们的组合特性。本文中,我们提出一种基于典型与或图(And-Or graph)的用于动作检测的新颖语法组合模型(GCM)。我们的模型以层次化方式利用动作的内在结构与潜在关系,兼具语法模型的组合性与 DNN 表达丰富特征的能力。所提模型可便捷地嵌入神经网络模块中以端到端方式高效优化。我们在 AVA 数据集与 Something-Else 任务上进行了大量实验,以证明我们模型的优越性,同时通过推理解析过程增强了可解释性。
引用
@article{arxiv.2310.02887,
title = {A Grammatical Compositional Model for Video Action Detection},
author = {Zhijun Zhang and Xu Zou and Jiahuan Zhou and Sheng Zhong and Ying Wu},
journal= {arXiv preprint arXiv:2310.02887},
year = {2023}
}