中文

Stable Signer:层次化手语生成模型

计算机视觉与模式识别 2026-02-03 v2 计算与语言 计算机与社会

摘要

手语生产(SLP)是将复杂输入文本转换为真实视频的过程。以往的研究侧重于 Text2Gloss、Gloss2Pose、Pose2Vid 阶段,或聚焦于 Prompt2Gloss 和 Text2Avatar 阶段。然而,该领域因文本转换不准确、姿态生成问题以及姿态渲染为真实人类视频的错误不断积累,进展缓慢。为此,本文简化传统冗余结构,优化任务目标,设计新型手语生成模型Stable Signer。将 SLP 任务重新定义为仅包含文本理解(Prompt2Gloss、Text2Gloss)和 Pose2Vid 的层次化端到端任务,通过我们提出的新型手语理解链接器(SLUL)执行文本理解,并通过命名的 SLP-MoE 手势渲染专家模块实现手势生成,端到端生成高质量且多样化的手语视频。SLUL 采用新开发的语义感知光掩码损失(SAGM Loss)进行训练。其性能较当前 SOTA 方法提升了 48.6%。

关键词

引用

@article{arxiv.2512.04048,
  title  = {Stable Signer: Hierarchical Sign Language Generative Model},
  author = {Sen Fang and Yalin Feng and Hongbin Zhong and Yanxin Zhang and Dimitris N. Metaxas},
  journal= {arXiv preprint arXiv:2512.04048},
  year   = {2026}
}

备注

12 pages, 7 figures. More Demo at https://stablesigner.github.io