中文

通过扩散模型建模对话意图、情感与上下文的会话式协同语音手势生成

人机交互 2024-01-12 v2

摘要

音频驱动的协同语音人体手势生成最近取得了显著进展。然而,大多数先前的工作仅专注于单人音频驱动的手势生成。我们旨在解决会话式协同语音手势生成问题,该问题考虑了对话中的多个参与者,由于难以同时整合主要说话者和对话者的语义信息及其他相关特征,这是一项新颖且具有挑战性的任务。为此,我们提出了 CoDiffuseGesture,这是一种基于扩散模型的方法,通过建模双边对话意图、情感和语义上下文来实现语音驱动的交互手势生成。我们的方法通过预训练语言模型在句子级别的意图感知模块和情感推理模块,为对话动作合成适当的、与语音匹配的、高质量的交互式手势。实验结果证明了所提出方法的优越性能。

关键词

引用

@article{arxiv.2312.15567,
  title  = {Conversational Co-Speech Gesture Generation via Modeling Dialog Intention, Emotion, and Context with Diffusion Models},
  author = {Haiwei Xue and Sicheng Yang and Zhensong Zhang and Zhiyong Wu and Minglei Li and Zonghong Dai and Helen Meng},
  journal= {arXiv preprint arXiv:2312.15567},
  year   = {2024}
}

备注

5 pages,2 figures, Accepted for publication at the 2024 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2024)