中文

隐式思维驱动的无词典签字语音翻译新范式

计算机视觉与模式识别 2026-04-20 v2

摘要

许多签字语音翻译 (SLT) 系统默默假设短暂的签字片段直接映射到口语单词。但这一假设不成立,因为签字者常常利用上下文、空间和运动动态即时创建意义。我们重新审视 SLT,认为其主要是跨模态推理任务,而非简单的视频到文本转换。因此,我们引入一种以潜在思维序列作为显式中间层的推理驱动 SLT 框架,这些潜在思维在时间上逐步提取和组织意义。此外,我们采用计划后 grounding 解码方法:模型首先决定要说什么,然后回溯视频寻找证据。这种分离提高了连贯性和忠实度。我们还构建并公开了一组新的大规模无词典 SLT 数据集,包含更强的上下文依赖和更真实的意义。跨多个基准的实验显示,我们的方法在现有无词典方法上 consistently 获得提升。我们的代码和数据已公开于 https://github.com/fletcherjiang/SignThought。

关键词

引用

@article{arxiv.2604.15301,
  title  = {Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language Translation},
  author = {Yiyang Jiang and Li Zhang and Xiao-Yong Wei and Li Qing},
  journal= {arXiv preprint arXiv:2604.15301},
  year   = {2026}
}

备注

Accepted to ACL 2026 Main