中文

SemGes: 利用语义一致性和相关性学习的语义感知共语手势生成

计算机视觉与模式识别 2025-07-28 v1

摘要

创建具有与语音对齐的语义一致手势的虚拟化身是一项具有挑战性的任务。现有的手势生成研究主要集中于生成有节奏的节拍手势,忽略了手势的语义上下文。在本文中,我们提出了一种新颖的共语手势生成中的语义基础化方法,该方法在细粒度和全局层面上整合了语义信息。我们的方法首先通过向量量化变分自编码器学习运动先验。在此模型基础上,应用第二阶段模块从语音、基于文本的语义和说话人身份自动生成手势,通过语义一致性和相关性模块确保生成手势的语义相关性与共现语音语义之间的一致性。实验结果表明,我们的方法增强了语义手势的真实感和连贯性。大量的实验和用户研究表明,在两个基准测试中,我们的方法在共语手势生成的客观和主观指标上均优于最先进的方法。我们模型的定性结果、代码、数据集和预训练模型可在 https://semgesture.github.io/ 查看。

关键词

引用

@article{arxiv.2507.19359,
  title  = {SemGes: Semantics-aware Co-Speech Gesture Generation using Semantic Coherence and Relevance Learning},
  author = {Lanmiao Liu and Esam Ghaleb and Aslı Özyürek and Zerrin Yumak},
  journal= {arXiv preprint arXiv:2507.19359},
  year   = {2025}
}

备注

Accepted to IEEE/CVF International Conference on Computer Vision (ICCV) 2025