中文

从音频到照片级逼真化身:合成对话中的人类

计算机视觉与模式识别 2024-01-04 v1

摘要

我们提出了一个框架,用于生成根据双人对话动态做出手势的全身照片级逼真化身。给定语音音频,我们为个体输出多种可能的手势动作,包括面部、身体和手部。我们方法的关键在于将向量量化带来的样本多样性优势与扩散模型获得的高频细节相结合,以生成更具动态性和表现力的动作。我们使用高度照片级逼真的化身来可视化生成的动作,这些化身能够表达手势中关键的细微差别(例如嘲笑和假笑)。为了促进这一研究方向,我们引入了一个首创的多视角对话数据集,该数据集允许进行照片级逼真重建。实验表明,我们的模型生成了恰当且多样的手势,优于仅使用扩散或仅使用 VQ 的方法。此外,我们的感知评估强调了照片级逼真度(相对于网格)在准确评估对话手势中细微动作细节方面的重要性。代码和数据集可在线获取。

关键词

引用

@article{arxiv.2401.01885,
  title  = {From Audio to Photoreal Embodiment: Synthesizing Humans in Conversations},
  author = {Evonne Ng and Javier Romero and Timur Bagautdinov and Shaojie Bai and Trevor Darrell and Angjoo Kanazawa and Alexander Richard},
  journal= {arXiv preprint arXiv:2401.01885},
  year   = {2024}
}