基于深度神经网络的逼真面对面对话系统
计算机视觉与模式识别
2019-08-22 v1 声音
音频与语音处理
图像与视频处理
摘要
为改善与虚拟形象面对面对话的体验,本文提出一种新颖的对话系统。它由分别用于听和说的两个序列到序列模型,以及基于生成对抗网络(GAN)的逼真虚拟形象合成器组成。这些模型利用面部动作与头部姿态学习自然的人类反应。基于模型输出,合成器使用 Pixel2Pixel 模型生成逼真的面部图像。为展示我们系统的改进,我们使用基于 3D 模型的虚拟形象驱动方案作为参考。我们利用来自 ESPN 节目的数据训练和评估我们的神经网络。实验结果表明,我们的对话系统能生成自然的面部反应和逼真的面部图像。
引用
@article{arxiv.1908.07750,
title = {A Realistic Face-to-Face Conversation System based on Deep Neural Networks},
author = {Zezhou Chen and Zhaoxiang Liu and Huan Hu and Jinqiang Bai and Shiguo Lian and Fuyuan Shi and Kai Wang},
journal= {arXiv preprint arXiv:1908.07750},
year = {2019}
}
备注
Accepted to ICCV 2019 workshop