基于事件流的手语翻译:高清基准数据集与新型基线方法
计算机视觉与模式识别
2025-12-01 v2 人工智能
计算与语言
神经与进化计算
摘要
手语翻译(SLT)是AI辅助残疾领域的一项核心任务。传统的SLT方法通常基于可见光视频,容易受到光照变化、快速手部运动和隐私问题等因素的影响。本文提出使用仿生事件相机来缓解上述问题。具体而言,我们引入了一个新的基于事件的高清手语数据集,称为Event-CSL,有效解决了该研究领域的数据稀缺问题。该数据集包含14,827个视频、14,821个glosses和2,544个文本词汇中的中文词汇。这些样本在多样化的室内外场景中收集,覆盖了多个视角、光照条件和相机运动。我们还在该数据集上对现有的主流SLT方法进行了基准测试,以促进未来研究的公平比较。此外,我们提出了一种新颖的基于事件的手语翻译框架,称为EvSLT。该框架首先将连续视频特征分割为片段,并采用基于Mamba的记忆聚合模块在片段级别压缩和聚合空间细节特征。随后,这些空间特征与通过时间卷积获得的时间表示由图引导的时空融合模块进行融合。在Event-CSL以及其他公开可用数据集上的广泛实验证明了我们方法的优越性能。数据集和源代码将发布在https://github.com/Event-AHU/OpenESL
引用
@article{arxiv.2408.10488,
title = {Event Stream-based Sign Language Translation: A High-Definition Benchmark Dataset and A Novel Baseline},
author = {Shiao Wang and Xiao Wang and Duoqing Yang and Yao Rong and Fuling Wang and Jianing Li and Lin Zhu and Bo Jiang},
journal= {arXiv preprint arXiv:2408.10488},
year = {2025}
}