中文

一种用于多模态动作识别的有效端到端解决方案

计算机视觉与模式识别 2025-06-12 v1

摘要

最近,多模态任务凭借其丰富的多模态信息有力推动了动作识别领域的发展。然而,由于三模态数据的稀缺,三模态动作识别任务的研究面临诸多挑战。为此,我们提出了一种全面的多模态动作识别解决方案,能够有效利用多模态信息。首先,通过优化数据增强技术对现有数据进行转换和扩展,以扩大训练规模。同时,使用更多的 RGB 数据集对骨干网络进行预训练,通过迁移学习使其更好地适应新任务。其次,借助 2D CNN 提取多模态空间特征,并结合时序移位模块(Temporal Shift Module, TSM),实现与 3D CNN 相当的多模态时空特征提取,同时提升计算效率。此外,采用常见的预测增强方法,如随机权重平均(Stochastic Weight Averaging, SWA)、集成学习(Ensemble)和测试时增强(Test-Time Augmentation, TTA),整合同一架构不同训练时期以及不同架构模型的知识,从而从不同角度预测动作并充分利用目标信息。最终,我们在竞赛排行榜上实现了 Top-1 准确率 99% 和 Top-5 准确率 100%,证明了该方案的优越性。

关键词

引用

@article{arxiv.2506.09345,
  title  = {An Effective End-to-End Solution for Multimodal Action Recognition},
  author = {Songping Wang and Xiantao Hu and Yueming Lyu and Caifeng Shan},
  journal= {arXiv preprint arXiv:2506.09345},
  year   = {2025}
}