中文

It Takes Two:基于反应自回归扩散模型的实时双人语音互动生成

声音 2024-12-04 v1 计算机视觉与模式识别 图形学 多媒体 音频与语音处理

摘要

对话场景在现实环境中十分常见,但现有的共语气动作合成方法在此类场景下常常不足,其中一方人的音频和手势会影响另一方的响应。此外,大多数现有方法依赖离线序列到序列框架,难以适用于在线应用。本文引入了一个面向对话中两个角色动态运动合成的音频驱动、自回归系统。我们方法的核心是基于扩散的全身动作合成模型,条件化于两个角色的过去状态、语音音频以及任务导向的运动轨迹输入,允许灵活的空间控制。为增强模型学习多样化互动的能力,我们丰富了现有的双人对话动作数据集,加入更具动态和互动性的动作。我们通过多项实验评估了该系统,展示其在包括单人和双人共语气动作生成以及交互式动作生成等多项任务上的优越性能。据我们了解,这是首个能够在线方式从语音为两个角色生成交互式全身运动的系统。

关键词

引用

@article{arxiv.2412.02419,
  title  = {It Takes Two: Real-time Co-Speech Two-person's Interaction Generation via Reactive Auto-regressive Diffusion Model},
  author = {Mingyi Shi and Dafei Qin and Leo Ho and Zhouyingcheng Liao and Yinghao Huang and Junichi Yamagishi and Taku Komura},
  journal= {arXiv preprint arXiv:2412.02419},
  year   = {2024}
}

备注

15 pages, 10 figures