探索基于姿态的手语翻译:消融研究与注意力洞察
计算机视觉与模式识别
2025-07-03 v1
摘要
手语翻译 (SLT) 已发生显著发展,从孤立识别方法发展到复杂的连续无 gloss 翻译系统。本文探讨了姿态基数据预处理技术——归一化、插值和数据增强——对 SLT 性能的影响。我们采用基于 Transformer 的架构,改进 T5 编码器-解码器模型以处理姿态表示。通过对 YouTubeASL 和 How2Sign 数据集上的大量消融研究,我们分析了不同的预处理策略如何影响翻译准确性。我们的结果表明,适当的归一化、插值和数据增强技术可以显著提高模型的鲁棒性和泛化能力。此外,我们提供了对模型注意力的深入分析,揭示了添加专用寄存器标记可改善整体模型性能的有趣行为。我们在 GitHub 仓库中发布了代码,包括预处理后的 YouTubeASL 数据。
引用
@article{arxiv.2507.01532,
title = {Exploring Pose-based Sign Language Translation: Ablation Studies and Attention Insights},
author = {Tomas Zelezny and Jakub Straka and Vaclav Javorek and Ondrej Valach and Marek Hruz and Ivan Gruber},
journal= {arXiv preprint arXiv:2507.01532},
year = {2025}
}
备注
8 pages, 9 figures, supplementary, SLRTP2025, CVPR2025