中文

基于多模态协同学习的高效骨架驱动动作识别

计算机视觉与模式识别 2024-08-16 v6

摘要

骨架驱动动作识别因其利用简洁且稳健的骨架而受到广泛关注。然而,骨架中缺乏详细身体信息会限制性能,而其他多模态方法在训练和推理阶段使用多模态数据时资源消耗大且效率不高。为此,我们提出一种新型多模态协同学习 (MMCL) 框架,利用多模态大语言模型 (LLM) 作为辅助网络,以实现对骨架驱动动作识别的高效学习。在训练阶段进行多模态协同学习,在推理阶段仅使用简洁的骨架数据以保持效率。我们的 MMCL 框架主要由两个模块构成:首先,特征对齐模块 (FAM) 从视频帧中提取丰富的 RGB 特征,并通过对比学习将其与全局骨架特征对齐;其次,特征细化模块 (FRM) 利用带有时间信息的 RGB 图像和文本指令,基于多模态 LLM 的强大泛化能力生成具有指导性的特征。这些具有指导性的文本特征将进一步细化分类得分,而经细化的得分将以类似软标签的方式提升模型的鲁棒性和泛化能力。广泛的在 NTU RGB+D、NTU RGB+D 120 和 Northwestern-UCLA 数据集上的实验一致证明了我们 MMCL 的有效性。同时,在 UTD-MHAD 和 SYSU-Action 数据集上的实验表明了 MMCL 在零样本和域自适应动作识别中的优异泛化能力。我们的代码已公开于 https://github.com/liujf69/MMCL-Action。

关键词

引用

@article{arxiv.2407.15706,
  title  = {Multi-Modality Co-Learning for Efficient Skeleton-based Action Recognition},
  author = {Jinfu Liu and Chen Chen and Mengyuan Liu},
  journal= {arXiv preprint arXiv:2407.15706},
  year   = {2024}
}