中文

利用集成学习进行跨视角孤立手语识别

计算机视觉与模式识别 2025-02-05 v1 人工智能

摘要

在本文中,我们提出了我们在 WWW 2025 举办的跨视角孤立手语识别(CV-ISLR)挑战赛中的解决方案。CV-ISLR 解决了传统孤立手语识别(ISLR)中的一个关键问题:现有数据集主要从正面视角采集手语视频,而现实世界中的摄像机视角往往多变。为了从不同视角准确识别手语,模型必须具备从多角度理解手势的能力,这使得跨视角识别极具挑战性。为了解决这一问题,我们探索了集成学习的优势,以增强模型在不同视角下的鲁棒性与泛化能力。我们的方法建立在多维 Video Swin Transformer 模型之上,利用该集成策略取得了具有竞争力的性能。最终,我们的解决方案在基于 RGB 的 ISLR 和基于 RGB-D 的 ISLR 两个赛道中均排名第三,证明了其在应对跨视角识别挑战方面的有效性。代码获取地址:https://github.com/Jiafei127/CV_ISLR_WWW2025。

关键词

引用

@article{arxiv.2502.02196,
  title  = {Exploiting Ensemble Learning for Cross-View Isolated Sign Language Recognition},
  author = {Fei Wang and Kun Li and Yiqi Nie and Zhangling Duan and Peng Zou and Zhiliang Wu and Yuwei Wang and Yanyan Wei},
  journal= {arXiv preprint arXiv:2502.02196},
  year   = {2025}
}

备注

3rd Place in Cross-View Isolated Sign Language Recognition Challenge at WWW 2025