一种基于层次图的方法用于视频中双手动作识别与描述生成
计算机视觉与模式识别
2023-10-03 v1
摘要
对视频中(双手)操作动作的细致理解及详细描述内容的生成,对于机器人学、人机交互和视频内容分析等学科十分重要。本研究描述了一种新颖方法,将基于图的建模与分层层次注意力机制相融合,从而提升了视频描述的精度与完备性。为此,我们首先用场景图编码物体与动作之间的时空相互依赖关系,随后在第二步中将此与一种新颖的 3 层架构相结合,利用图注意力网络(GATs)构建层次注意力机制。该 3 层 GAT 架构既能识别局部也能识别全局上下文要素。由此可为同一视频片段并行生成若干具有不同语义复杂度的描述,提升动作识别与动作描述的判别准确率。我们方法的表现使用多个 2D 和 3D 数据集进行了实证测试。通过与当前最优(SOTA)方法比较,我们在动作识别与描述生成的准确性、精确度和上下文相关性上均持续取得更优表现。在大量消融实验中,我们也评估了模型各组件的作用。我们的多层次方法使系统获得不同的语义描述深度,这也常常见于不同人所作的描述中。此外,我们的模型对双手手-物交互的更好洞察或预示机器人领域的进步,得以更高精度地模仿复杂人类动作。
引用
@article{arxiv.2310.00670,
title = {A Hierarchical Graph-based Approach for Recognition and Description Generation of Bimanual Actions in Videos},
author = {Fatemeh Ziaeetabar and Reza Safabakhsh and Saeedeh Momtazi and Minija Tamosiunaite and Florentin Wörgötter},
journal= {arXiv preprint arXiv:2310.00670},
year = {2023}
}