中文

Text2Sign Diffusion:面向无词典手语生成的扩散模型方法

计算与语言 2025-09-16 v1 多媒体

摘要

手语生产(SLP)旨在将 spoken language 句子翻译成手语中的姿态帧序列,弥合听力丧失者数字包容之间的沟通障碍。现有方法通常依赖于 gloss——手语单词或短语的符号表示——作为 SLP 的中间步骤。这限制了 SLP 的灵活性和泛化能力,因为 gloss 注释往往不可用且具有语言特定性。因此,我们提出了一种新颖的基于扩散的生成方法——Text2Sign Diffusion(Text2SignDiff)——用于无 gloss SLP。具体而言,提出了一种无 gloss 潜在扩散模型,用于从带噪声的潜在手语代码和 spoken text 联合生成手语序列,通过非自回归式迭代去噪过程减少潜在的错误累积。我们还设计了一个跨模态手势对齐器,通过学习手语和 spoken language 之间的共享潜在空间来桥接视觉与文本内容。这种对齐支持基于扩散的条件生成过程,使手语生成更加准确且在上下文上更具相关性,而无需 gloss。在常用的数据集 PHOENIX14T 和 How2Sign 上进行的大规模实验表明,我们的方法有效,实现了最新的性能水平。

关键词

引用

@article{arxiv.2509.10845,
  title  = {Text2Sign Diffusion: A Generative Approach for Gloss-Free Sign Language Production},
  author = {Liqian Feng and Lintao Wang and Kun Hu and Dehui Kong and Zhiyong Wang},
  journal= {arXiv preprint arXiv:2509.10845},
  year   = {2025}
}