中文

PersonaGest:基于语义引导的层次化运动表示的个性化共语气体生成

图形学 2026-05-11 v1 计算机视觉与模式识别 多媒体

摘要

共语气体生成旨在合成与言语语义一致且忠实于用户指定 gestural style 的逼真身体动作。现有基于VQ-VAE的共语气体生成方法在生成质量方面取得进展,但未能将语义结构编码到运动表示中,或明确解耦 content 与 style,这限制了语义一致性和个人化保真度。我们提出PersonaGest,这是一个两阶段框架,旨在解决上述问题。在第一阶段,语义引导的RVQ-VAE在残差量化结构中解耦运动 content 与 gestural style,其中语义感知运动词典(Semantic-Aware Motion Codebook, SMoC)按 gesture 语义组织 content 词典,并通过对比学习进一步强化 content-style 隔离。在第二阶段,掩码生成式Transformer通过语义感知的 re-masking 策略生成 content tokens,随后依据参考运动提示对 style Residual Transformers 进行级联,实现 style 控制。广泛的实验表明,我们的方法在客观指标和感知用户研究中均实现了最先进的性能,并展现出对参考提示的强烈风格一致性。我们的项目页面已提供演示视频,网址为https://danny-nus.github.io/PersonaGest/

关键词

引用

@article{arxiv.2605.07252,
  title  = {PersonaGest: Personalized Co-Speech Gesture Generation with Semantic-Guided Hierarchical Motion Representation},
  author = {Junchuan Zhao and Qifan Liang and Ye Wang},
  journal= {arXiv preprint arXiv:2605.07252},
  year   = {2026}
}

备注

26 pages, 10 figures, 12 tables