迈向在线连续手语识别与翻译
计算机视觉与模式识别
2024-09-24 v2
摘要
连续手语识别(CSLR)研究对于弥合聋人与听人之间的沟通差距至关重要。许多先前研究使用连接主义时序分类(CTC)损失训练其模型。在推理过程中,这些基于 CTC 的模型通常需要整个手语视频作为输入来进行预测,这一过程称为离线识别,存在高延迟和大内存占用的问题。在这项工作中,我们迈出了迈向在线 CSLR 的第一步。我们的方法包含三个阶段:1)开发手语词典;2)在词典上训练孤立手语识别模型;3)对输入手语序列采用滑动窗口方法,将每个手语片段送入优化后的模型进行在线识别。此外,我们的在线识别模型可以通过集成字面到文本网络扩展以支持在线翻译,并能提升任何离线模型的性能。通过这些扩展,我们的在线方法在各种任务设置的三个流行基准测试中取得了新的最先进性能。代码和模型可在 https://github.com/FangyunWei/SLRT 获取。
引用
@article{arxiv.2401.05336,
title = {Towards Online Continuous Sign Language Recognition and Translation},
author = {Ronglai Zuo and Fangyun Wei and Brian Mak},
journal= {arXiv preprint arXiv:2401.05336},
year = {2024}
}
备注
Accepted to EMNLP 2024