中文

无 gloss 手语翻译:基于手部特征的框架

计算机视觉与模式识别 2025-09-03 v2

摘要

手语翻译(SLT)是一项具有挑战性的任务,需要在视觉与语言信息之间搭建跨模态桥梁,同时捕捉手部形状和运动的细微变化。为此,我们提出了一种新颖的无 gloss 手语翻译框架"BeyondGloss",其利用视频大型语言模型(VideoLLM)的时空推理能力。由于现有VideoLLM难以详细建模长视频,我们提出一种方法生成手部运动的细粒度、时序感知的文本描述。在预训练期间,通过对比对齐模块将这些描述与视频特征对齐,鼓励模型聚焦于手部特性的时序动力学并更有效地区分手势。为进一步丰富手部特定表示,我们从HaMeR蒸馏出细粒度特征。此外,我们应用置信对齐损失 between sign video representations 与目标语言嵌入,以减少预训练期间的模态间隙。"BeyondGloss"在Phoenix14T和CSL-Daily基准测试上实现了最先进性能,证明了所提出框架的有效性。我们将在论文被接受后发布代码。

关键词

引用

@article{arxiv.2507.23575,
  title  = {Beyond Gloss: A Hand-Centric Framework for Gloss-Free Sign Language Translation},
  author = {Sobhan Asasi and Mohamed Ilyas Lakhal and Ozge Mercanoglu Sincan and Richard Bowden},
  journal= {arXiv preprint arXiv:2507.23575},
  year   = {2025}
}

备注

Accepted at BMVC 2025