运动是舞者:学习潜在姿态动力学以实现无缝手语生成
计算机视觉与模式识别
2025-08-07 v1
摘要
手语视频生成需要在精确语义控制下生成自然的签字动作和逼真的外观,但面临两个关键挑战:过度依赖签名者特定数据,以及泛化性差。我们提出一种新的手语视频生成范式,通过解耦运动语义与签名者身份,构建双阶段合成框架。首先,构建签名者无关的多模态运动词典,每个 gloss 以身份无关的姿态、手势和3D网格序列存储,仅需一笔录制即可。这种紧凑表示使我们的第二项关键创新成为可能:离散到连续的运动合成阶段,将检索到的 gloss 序列转化为时序连贯的运动轨迹,随后通过身份感知神经渲染生成任意签名者的逼真视频。与受签名者特定数据集限制的先前工作不同,我们将运动视为一等公民:所学的潜在姿态动力学作为可移植的「编舞层」可通过不同人形外观实现视觉化。广泛实验表明,解耦运动与身份不仅可行,而且具有优势——既实现高质量合成,又实现签名者个性化的前所未有的灵活性。
引用
@article{arxiv.2508.04049,
title = {Motion is the Choreographer: Learning Latent Pose Dynamics for Seamless Sign Language Generation},
author = {Jiayi He and Xu Wang and Shengeng Tang and Yaxiong Wang and Lechao Cheng and Dan Guo},
journal= {arXiv preprint arXiv:2508.04049},
year = {2025}
}
备注
9 pages, 6 figures