中文

基于深度神经网络的逼真面对面对话系统

计算机视觉与模式识别 2019-08-22 v1 声音 音频与语音处理 图像与视频处理

摘要

为改善与虚拟形象面对面对话的体验,本文提出一种新颖的对话系统。它由分别用于听和说的两个序列到序列模型,以及基于生成对抗网络(GAN)的逼真虚拟形象合成器组成。这些模型利用面部动作与头部姿态学习自然的人类反应。基于模型输出,合成器使用 Pixel2Pixel 模型生成逼真的面部图像。为展示我们系统的改进,我们使用基于 3D 模型的虚拟形象驱动方案作为参考。我们利用来自 ESPN 节目的数据训练和评估我们的神经网络。实验结果表明,我们的对话系统能生成自然的面部反应和逼真的面部图像。

关键词

引用

@article{arxiv.1908.07750,
  title  = {A Realistic Face-to-Face Conversation System based on Deep Neural Networks},
  author = {Zezhou Chen and Zhaoxiang Liu and Huan Hu and Jinqiang Bai and Shiguo Lian and Fuyuan Shi and Kai Wang},
  journal= {arXiv preprint arXiv:1908.07750},
  year   = {2019}
}

备注

Accepted to ICCV 2019 workshop