中文

基于扩散反演的共语手势生成统一编辑方法

人机交互 2024-04-04 v1

摘要

扩散模型在从带有语音音频或文本条件的噪声输入中为交互式人形机器人或数字化身生成高质量的共语手势方面取得了巨大成功。然而,除了风格调节等高级专门措施外,它们很少关注为内容创作者提供丰富的编辑能力。为了解决这个问题,我们提出了一个利用扩散反演的统一框架,该框架无需重新训练即可实现共语手势生成的多级编辑能力。该方法利用了可逆扩散模型的两个关键能力。首先,通过反演,我们可以从手势重建中间噪声,并从噪声中生成新的手势。这可用于针对不同语音条件获得与原始手势具有高级相似性的手势。其次,这种重建减少了梯度计算期间的激活缓存需求,使得在内存有限的当前硬件上直接优化输入噪声成为可能。通过为例如关节旋转或速度设计的不同损失函数,我们可以通过优化自动调整输入噪声来控制各种低级细节。在多个用例上的大量实验表明,该框架成功统一了高级和低级共语手势编辑。

关键词

引用

@article{arxiv.2404.02411,
  title  = {A Unified Editing Method for Co-Speech Gesture Generation via Diffusion Inversion},
  author = {Zeyu Zhao and Nan Gao and Zhi Zeng and Guixuan Zhang and Jie Liu and Shuwu Zhang},
  journal= {arXiv preprint arXiv:2404.02411},
  year   = {2024}
}