中文

使用帧与事件流的机器翻译:基准数据集与算法

计算机视觉与模式识别 2025-03-11 v1 人工智能 神经与进化计算

摘要

准确的手语理解是残障人士的重要沟通渠道。当前的手语翻译算法主要依赖 RGB 帧,这可能受到固定帧率、可变光照条件以及手部快速运动引起的运动模糊的限制。受事件相机在其他领域近期成功应用的启发,我们提出利用事件流辅助 RGB 相机捕捉手势数据,以解决上述各种挑战。具体而言,我们首先使用 DVS346 相机收集了一个大规模 RGB-Event 手语翻译数据集,称为 VECSL,包含 15,676 个 RGB-Event 样本、15,191 个手语词(glosses),涵盖 2,568 个汉字。这些样本在各种室内外环境中采集,捕捉了多个视角、不同光照强度和不同的相机运动。由于缺乏用于此新任务对比的基准算法,我们重新训练并评估了多种 SOTA SLT 算法,并相信该基准能有效支持后续的相关研究。此外,我们提出了一种新颖的 RGB-Event 手语翻译框架(即 M2^2-SLT),该框架结合了细粒度微手势和粗粒度宏手势检索,在所提出的数据集上取得了 SOTA 结果。源代码和数据集将发布于 https://github.com/Event-AHU/OpenESL。

关键词

引用

@article{arxiv.2503.06484,
  title  = {Sign Language Translation using Frame and Event Stream: Benchmark Dataset and Algorithms},
  author = {Xiao Wang and Yuehang Li and Fuling Wang and Bo Jiang and Yaowei Wang and Yonghong Tian and Jin Tang and Bin Luo},
  journal= {arXiv preprint arXiv:2503.06484},
  year   = {2025}
}

备注

In Peer Review