中文

EvSign:基于流式事件的手语识别与翻译

计算机视觉与模式识别 2024-07-23 v2

摘要

手语是聋人最有效的交流工具之一。现有大多数研究致力于提高RGB视频上的手语任务性能,但可能受录制条件恶化的影响,如手部快速移动导致运动模糊和签字者外观纹理问题。生物仿生事件相机能够以高速异步捕获亮度变化,能够自然感知动态手部运动,为手语任务提供丰富的手部线索。本文旨在探索事件相机在连续手语识别(CSLR)和手语翻译(SLT)中的潜力。为推动研究发展,我们首次收集了包含gloss和口语注释的基于事件的基准数据集EvSign,以支持上述任务。EvSign数据集提供了大量高质量事件流和广泛的gloss和词汇,促进了手语任务的发展。此外,我们提出了一种高效的基于转换器的框架,用于事件-based手语识别和翻译任务,充分利用了流式事件的优势。稀疏主干网络用于从稀疏事件中提取视觉特征。随后,通过提出的局部token融合和gloss感知时间聚合模块有效利用时序一致性。在模拟数据集(PHOENIX14T)和EvSign数据集上的大量实验表明,我们的方法在仅0.34%计算开销(每个视频0.84G FLOPS)和44.2%网络参数的情况下,相较于现有最先进方法表现更佳。项目可在https://zhang-pengyu.github.io/EVSign访问。

关键词

引用

@article{arxiv.2407.12593,
  title  = {EvSign: Sign Language Recognition and Translation with Streaming Events},
  author = {Pengyu Zhang and Hao Yin and Zeren Wang and Wenyue Chen and Shengming Li and Dong Wang and Huchuan Lu and Xu Jia},
  journal= {arXiv preprint arXiv:2407.12593},
  year   = {2024}
}

备注

To appear on ECCV 2024