手语的深度理解用于手语到字幕对齐
计算机视觉与模式识别
2025-03-06 v1
摘要
本研究的目标是在标注数据有限的情况下,将手语视频中的异步字幕进行对齐。为实现这一目标,我们提出了一种新颖框架,其贡献包括:(1)我们利用英国手语(BSL)的基本语法规则对输入字幕进行预处理;(2)我们设计了选择性对齐损失,以优化模型仅在查询的手语实际出现在场景中时才预测其时间位置;(3)我们通过更精确的启发式音频对齐标签进行自训练,获取经过精修的伪标签。由此,我们的模型不仅更好地理解文本与手语之间的关联,还具有应用于手语翻译的潜力,特别是在大规模手语数据的人工标注不切实际或具有挑战性的场景中。广泛的实验结果表明,我们的方法取得了最先进的成果,在帧级准确率和F1分数方面均大幅超越先前基线。这凸显了我们框架在推进手语视频对齐与翻译领域的有效性和实用性。
引用
@article{arxiv.2503.03287,
title = {Deep Understanding of Sign Language for Sign to Subtitle Alignment},
author = {Youngjoon Jang and Jeongsoo Choi and Junseok Ahn and Joon Son Chung},
journal= {arXiv preprint arXiv:2503.03287},
year = {2025}
}