Fingerspelling PoseNet:基于姿态的 Transformer 模型增强手指拼写翻译
计算机视觉与模式识别
2023-11-22 v1 人机交互
摘要
我们针对真实场景视频中的美国手语手指拼写翻译任务展开研究。我们利用更精确的手部姿态估计的最新进展,提出了一种新颖的架构,该架构采用基于 Transformer 的编码器-解码器模型,可实现无缝的上下文单词翻译。该翻译模型通过一项新颖的损失项得到增强,该损失项可准确预测手指拼写单词的长度,有益于训练和推理。我们还提出了一种新颖的两阶段推理方法,利用解码器的语言模型能力对假设进行重排序。通过大量实验,我们证明所提方法在 ChicagoFSWild 和 ChicagoFSWild+ 上优于当前最先进(SOTA)的模型,性能相对提升超过 10%。我们的发现凸显了该方法的有效性及其在推动手语翻译中手指拼写识别方面的潜力。代码已发布于 https://github.com/pooyafayyaz/Fingerspelling-PoseNet。
引用
@article{arxiv.2311.12128,
title = {Fingerspelling PoseNet: Enhancing Fingerspelling Translation with Pose-Based Transformer Models},
author = {Pooya Fayyazsanavi and Negar Nejatishahidin and Jana Kosecka},
journal= {arXiv preprint arXiv:2311.12128},
year = {2023}
}
备注
WACV 2024