用于人类动作识别的跨模态一致性统一框架
计算机视觉与模式识别
2024-09-05 v1
摘要
识别视频中的人类动作由于人类相互作用的时空复杂性和情境依赖性,具有挑战性。先前的研究往往依赖单一输入模态(如RGB或骨骼数据),限制了其利用跨模态互补优势的能力。近期研究聚焦于使用简单特征融合技术组合这两种模态。然而,由于这些输入模态之间表示的内在差异,设计一种统一的神经网络架构来有效利用其互补信息仍是一个重大挑战。为此,我们提出了一个全面的多模态框架,用于稳健的基于视频的人类动作识别。我们的关键贡献是引入一种新型组成查询机器,称为COMPUTER(Compositional Human-centric Query machine),一种通用神经网络架构,用于在空间和时间上建模人物及其周围环境之间的相互作用。得益于其通用设计,COMPUTER可以被用于为各种输入模态提取独特的表示。此外,我们引入一致性损失,以强制不同模态之间的预测一致,从而利用多模态输入的互补信息实现稳健的人体动作识别。通过在动作定位和团体动作识别任务上的大量实验,我们的方法在与最先进方法相比方面表现出优异的性能。我们的代码可在https://github.com/tranxuantuyen/COMPUTER获取。
引用
@article{arxiv.2409.02385,
title = {Unified Framework with Consistency across Modalities for Human Activity Recognition},
author = {Tuyen Tran and Thao Minh Le and Hung Tran and Truyen Tran},
journal= {arXiv preprint arXiv:2409.02385},
year = {2024}
}
备注
Accepted to BMVC 2024