中文

FusionEnsemble-Net:用于多模态手语识别的基于注意力的时空网络集成

计算机视觉与模式识别 2025-08-14 v1 人工智能 机器学习

摘要

在医疗保健交流中准确识别手语是一项重大挑战,需要能够准确解释复杂多模态手势的框架。为了解决这一问题,我们提出了 FusionEnsemble-Net,这是一种新颖的基于注意力的时空网络集成,可动态融合视觉与运动数据以提升识别准确率。所提出的方法通过四个不同的时空网络同步处理 RGB 视频和距离多普勒图雷达模态。对于每个网络,两种模态的特征在输入分类器集成之前,会使用基于注意力的融合模块进行持续融合。最后,这四个不同融合通道的输出在集成分类头中组合,从而增强模型的鲁棒性。实验表明,FusionEnsemble-Net 在大规模意大利手语 MultiMeDaLIS 数据集上的测试准确率达到 99.44%,优于现有方法。我们的研究结果表明,由基于注意力的融合统一起来的多样化时空网络集成,为复杂、多模态的孤立手势识别任务提供了一个鲁棒且准确的框架。源代码可在:https://github.com/rezwanh001/Multimodal-Isolated-Italian-Sign-Language-Recognition 获取。

关键词

引用

@article{arxiv.2508.09362,
  title  = {FusionEnsemble-Net: An Attention-Based Ensemble of Spatiotemporal Networks for Multimodal Sign Language Recognition},
  author = {Md. Milon Islam and Md Rezwanul Haque and S M Taslim Uddin Raju and Fakhri Karray},
  journal= {arXiv preprint arXiv:2508.09362},
  year   = {2025}
}

备注

Accepted for the IEEE/CVF International Conference on Computer Vision (ICCV), Honolulu, Hawaii, USA. 1st MSLR Workshop 2025