中文

DiffSHEG:一种基于扩散的实时语音驱动整体3D表情与手势生成方法

声音 2024-04-09 v2 人工智能 计算机视觉与模式识别 图形学 音频与语音处理

摘要

我们提出DiffSHEG,一种基于扩散(Diffusion)的方法,用于生成任意时长的语音驱动整体3D表情与手势。以往工作分别关注协同语音的手势或表情生成,而同步表情与手势的联合生成几乎未被探索。为解决这一问题,我们基于扩散的协同语音运动生成Transformer实现了从表情到手势的单向信息流,有助于改善联合表情-手势分布的匹配。此外,我们引入了一种基于外绘(outpainting)的采样策略,用于扩散模型中任意长序列的生成,提供了灵活性和计算效率。我们的方法提供了一种实用解决方案,能够生成由语音驱动的高质量同步表情与手势。在两个公开数据集上评估,我们的方法在定量和定性方面均达到了最先进的性能。此外,一项用户研究证实了DiffSHEG相较于先前方法的优越性。通过实现富有表现力的同步运动的实时生成,DiffSHEG展示了其在数字人和具身智能体开发等多种应用中的潜力。

关键词

引用

@article{arxiv.2401.04747,
  title  = {DiffSHEG: A Diffusion-Based Approach for Real-Time Speech-driven Holistic 3D Expression and Gesture Generation},
  author = {Junming Chen and Yunfei Liu and Jianan Wang and Ailing Zeng and Yu Li and Qifeng Chen},
  journal= {arXiv preprint arXiv:2401.04747},
  year   = {2024}
}

备注

Accepted by CVPR 2024. Project page: https://jeremycjm.github.io/proj/DiffSHEG