GestureDiffuCLIP:基于CLIP潜变量的手势扩散模型
计算机视觉与模式识别
2023-10-17 v4 图形学
摘要
风格化协同语音手势的自动生成近来受到越来越多的关注。以往的系统通常通过预定义文本标签或示例运动片段来实现风格控制,往往不够灵活以准确传达用户意图。在本工作中,我们提出GestureDiffuCLIP,一个用于合成逼真、风格化协同语音手势并具有灵活风格控制的神经网络框架。我们利用大规模对比语言-图像预训练(CLIP)模型的能力,提出一种新颖的CLIP引导机制,从多种输入模态(如一段文本、一个示例运动片段或一段视频)中提取高效的风格表示。我们的系统学习一个潜扩散模型以生成高质量手势,并通过自适应实例归一化(AdaIN)层将风格的CLIP表示注入生成器。我们进一步设计了一种手势-文本对齐机制,基于对比学习确保语义正确的手势生成。我们的系统还可扩展以允许对身体各部位进行细粒度风格控制。我们展示了一系列广泛的示例,表明我们的模型对多种风格描述具有灵活性与泛化能力。在用户研究中,我们表明我们的系统在类人度、恰当性和风格正确性方面优于最先进的方法。
引用
@article{arxiv.2303.14613,
title = {GestureDiffuCLIP: Gesture Diffusion Model with CLIP Latents},
author = {Tenglong Ao and Zeyi Zhang and Libin Liu},
journal= {arXiv preprint arXiv:2303.14613},
year = {2023}
}
备注
SIGGRAPH 2023 (Journal Track); Project Page: https://pku-mocca.github.io/GestureDiffuCLIP-Page/