中文

HandReader:高效手势拼写识别的先进技术

计算机视觉与模式识别 2025-05-16 v1 机器学习

摘要

手势拼写是符号语言(SL)的一个重要组成部分,允许解释专有名词, characterized by signing时快速的手部动作。尽管先前的手势拼写识别工作侧重于处理视频的时间维度,但仍有提高这些方法准确率的空间。本文引入HandReader,一组针对手势拼写识别任务设计的三个架构。HandReaderRGB_{RGB}采用新颖的时序位移自适应模块(TSAM)处理各长度视频的RGB特征,同时保留重要的序列信息。HandReaderKP_{KP}基于提出的时序姿态编码器(TPE)在关键点上运行,作为张量处理。这种关键点在批次中的组合允许编码器通过2D和3D卷积层处理,利用时空信息并累积关键点坐标。我们还引入HandReader_RGB+KP - 具备联合编码器的架构,以从RGB和关键点模态中获益。每个HandReader模型都具有各自的优势,并在ChicagoFSWild和ChicagoFSWild+数据集上实现最先进的结果。此外,模型在本文提出的第一个俄语手势拼写数据集Znaki上表现出色。Znaki数据集和HandReader预训练模型均公开可用。

关键词

引用

@article{arxiv.2505.10267,
  title  = {HandReader: Advanced Techniques for Efficient Fingerspelling Recognition},
  author = {Pavel Korotaev and Petr Surovtsev and Alexander Kapitanov and Karina Kvanchiani and Aleksandr Nagaev},
  journal= {arXiv preprint arXiv:2505.10267},
  year   = {2025}
}

备注

https://github.com/ai-forever/handreader