中文

LivelySpeaker:面向语义感知的语音同步手势生成

计算机视觉与模式识别 2023-09-19 v1

摘要

手势是伴随人们言语的非语言但重要的行为。尽管先前方法能够生成与语音节奏同步的手势,但言语的语义上下文通常缺失于这些手势之中。虽然语义手势在人类言语中并不十分规律地出现,但它们确实是受众在更具沉浸感的环境中理解言语上下文的关键。因此,我们提出 LivelySpeaker,一个实现语义感知的语音同步手势生成并提供若干控制接口的框架。具体而言,我们的方法将该任务解耦为两个阶段:基于文本脚本的手势生成与音频引导的节奏细化。具体地,基于文本脚本的手势生成利用预训练的 CLIP 文本嵌入作为引导,以生成与脚本高度语义对齐的手势。随后,我们设计了一个简单而有效的基于扩散的手势生成主干,仅使用纯 MLP,以音频信号为条件并学习以逼真动作进行手势表达。我们利用这一强大先验在零样本设定下使脚本引导的手势与音频信号合拍。我们新颖的两阶段生成框架还支持若干应用,如改变手势风格、通过文本提示编辑语音同步手势,以及通过引导扩散控制语义感知与节奏对齐。大量实验证明了所提框架相较对比方法的优势。此外,我们的核心基于扩散的生成模型在两个基准上也取得了最先进的性能。代码与模型将公开发布以促进未来研究。

关键词

引用

@article{arxiv.2309.09294,
  title  = {LivelySpeaker: Towards Semantic-Aware Co-Speech Gesture Generation},
  author = {Yihao Zhi and Xiaodong Cun and Xuelin Chen and Xi Shen and Wen Guo and Shaoli Huang and Shenghua Gao},
  journal= {arXiv preprint arXiv:2309.09294},
  year   = {2023}
}

备注

Accepted by ICCV 2023