中文

利用多模态训练提升单模态动态手势识别性能

计算机视觉与模式识别 2025-10-13 v2 人工智能 人机交互 机器学习 机器学习

摘要

我们提出了一种高效方法,在训练用于动态手势识别任务的单模态3D卷积神经网络(3D-CNNs)时利用来自多模态的知识。与许多最先进方法中常见的显式融合多模态信息不同,我们提出了一种不同的框架,将多模态知识嵌入到各个网络中,使每个单模态网络都能获得性能提升。具体而言,我们为每种可用模态分配独立网络,并强制它们协作学习,以开发出具有共同语义和更优表示的网络。我们引入“时空语义对齐”损失(SSA)来对齐来自不同网络的特征内容。此外,我们用提出的“焦点正则化参数”对该损失进行正则化,以避免负向知识迁移。实验结果表明,我们的框架提升了单模态网络的测试时识别准确率,并在多个动态手势识别数据集上取得了最先进的性能。

关键词

引用

@article{arxiv.1812.06145,
  title  = {Improving the Performance of Unimodal Dynamic Hand-Gesture Recognition with Multimodal Training},
  author = {Mahdi Abavisani and Hamid Reza Vaezi Joze and Vishal M. Patel},
  journal= {arXiv preprint arXiv:1812.06145},
  year   = {2025}
}