中文

面向人类动作识别的多模态深度网络自适应融合

计算机视觉与模式识别 2025-12-05 v1

摘要

本研究提出了一种通过利用深度神经网络技术和多模态自适应融合策略进行人类动作识别的开创性方法,涵盖 RGB、光流、音频和深度信息等多模态。采用门控机制进行多模态融合,旨在克服传统单模态识别方法的固有局限,同时探索多样化应用的新可能性。通过对门控机制和基于自适应权重的融合架构进行 exhaustive 调查,我们的方法实现了从各模态中选择性整合相关信息,从而增强了动作识别任务的准确性和鲁棒性。我们仔细审视了各种门控融合策略,以确定多模态动作识别的最有效方法,展示了其相对于传统单模态方法的优越性。门控机制促进了关键特征的提取,从而实现对动作的更全面表示,并在识别性能上获得显著提升。我们在人类动作识别、暴力行为检测以及多个基准数据集上的自监督学习任务上的评估展示了令人鼓舞的准确性进展。本研究的意义在于其有望彻底改变各领域的动作识别系统。多模态信息的融合有望在监控和人机交互领域实现更复杂的应用,特别是在主动辅助生活的相关场景中。

关键词

引用

@article{arxiv.2512.04943,
  title  = {Towards Adaptive Fusion of Multimodal Deep Networks for Human Action Recognition},
  author = {Novanto Yudistira},
  journal= {arXiv preprint arXiv:2512.04943},
  year   = {2025}
}