中文

MM-Gesture:面向精准微动作识别的多模态融合方法

计算机视觉与模式识别 2025-08-06 v2

摘要

本文提出了MM-Gesture——我们团队HFUT-VUT所开发的解决方案,该团队在2025年IJCAI第三届MiGA挑战赛微动作分类赛道中取得1名成绩,相较于以往领先方法实现了卓越的性能。MM-Gesture是为识别细微且持续时间短的微动作(MG)而设计的多模态融合框架,集成了来自关节、肢体、RGB视频、Taylor级数视频、光流视频和深度视频等模态的互补线索。该方法基于PoseConv3D和Video Swin Transformer架构,引入新颖的模态加权集成策略,并通过在更大数据集MA-52上预训练的transfer learning技术进一步提升RGB模态的性能。在iMiGUE基准测试上的大量实验,包括不同模态的消融实验,验证了我们方法的有效性,实现了73.213%的Top-1准确率。代码已公开:https://github.com/momiji-bit/MM-Gesture。

关键词

引用

@article{arxiv.2507.08344,
  title  = {MM-Gesture: Towards Precise Micro-Gesture Recognition through Multimodal Fusion},
  author = {Jihao Gu and Fei Wang and Kun Li and Yanyan Wei and Zhiliang Wu and Dan Guo},
  journal= {arXiv preprint arXiv:2507.08344},
  year   = {2025}
}

备注

1st Place in Micro-gesture Classification sub-challenge in 3rd MiGA at IJCAI 2025