中文

用于连续手语边界检测的 Transformer 模型

计算机视觉与模式识别 2024-02-23 v1

摘要

手语识别(SLR)近年来引起了研究人员的广泛关注,特别是连续手语识别(CSLR)这一复杂领域,其相较于孤立手语识别(ISLR)呈现出更高的复杂性。CSLR 中的一个主要挑战是在连续视频流中准确检测孤立手语的边界。此外,现有模型对手工特征的依赖对实现最佳精度构成了挑战。为了克服这些挑战,我们提出了一种利用基于 Transformer 模型的新方法。与传统模型不同,我们的方法专注于提高精度,同时消除了对手工特征的需求。Transformer 模型被用于 ISLR 和 CSLR。训练过程涉及使用孤立手语视频,其中从输入视频中提取的手部关键点特征通过 Transformer 模型得到增强。随后,这些增强的特征被送入最终分类层。训练好的模型结合后处理方法,随后被应用于检测连续手语视频中的孤立手语边界。我们在两个不同的数据集上对我们的模型进行了评估,包括连续手语及其对应的孤立手语,结果显示出了良好的前景。

关键词

引用

@article{arxiv.2402.14720,
  title  = {A Transformer Model for Boundary Detection in Continuous Sign Language},
  author = {Razieh Rastgoo and Kourosh Kiani and Sergio Escalera},
  journal= {arXiv preprint arXiv:2402.14720},
  year   = {2024}
}