中文

利用 WaveNet 构建语音动态听者头部建模

计算机视觉与模式识别 2024-09-10 v1

摘要

听者面部反应的创建旨在模拟听者在面对面对话期间的交互式沟通反馈。我们的目标是通过一种结合了 WaveNet 和长短期记忆网络的序列到序列模型,生成对单一说话者作出真实反应的听者头部视频。我们的 метод方法侧重于捕捉听者反馈的细微细节,确保保留听者的个人身份同时表达适当的态度和观点。实验结果表明,我们的方法在 ViCo 数据集上优于基线模型。

关键词

引用

@article{arxiv.2409.05089,
  title  = {Leveraging WaveNet for Dynamic Listening Head Modeling from Speech},
  author = {Minh-Duc Nguyen and Hyung-Jeong Yang and Seung-Won Kim and Ji-Eun Shin and Soo-Hyung Kim},
  journal= {arXiv preprint arXiv:2409.05089},
  year   = {2024}
}