DialogueNeRF:面向逼真虚拟人面对面对话视频生成
计算机视觉与模式识别
2023-08-15 v2 图像与视频处理
摘要
对话是元宇宙中虚拟人活动的核心组成部分。随着自然语言处理的发展,文本与语音对话生成已取得显著突破。然而,日常对话中绝大多数为面对面交流,而现有方法多聚焦于单人说话头生成。本文更进一步,考虑生成逼真的面对面对话视频。对话生成比单人说话头生成更具挑战性,因其不仅需生成照片级真实感的个体说话头,还要求听者对标者作出回应。我们提出一种基于神经辐射场(NeRF)的新颖统一框架来解决该任务。具体而言,我们用NeRF框架建模说话者与听者,并以不同条件控制各自表情:说话者由音频信号驱动,听者响应则依赖于视觉与声学信息。由此,在同一网络内建模所有对话者,生成人类虚拟人之间的面对面对话视频。此外,为推进该任务未来研究,我们收集了包含34段视频片段的新人类对话数据集。定量与定性实验从图像质量、姿态序列趋势及渲染视频自然度等方面评估了我们的方法。实验结果表明,所得视频中的虚拟人能够进行逼真对话并保持个体风格。所有代码、数据与模型将公开可用。
引用
@article{arxiv.2203.07931,
title = {DialogueNeRF: Towards Realistic Avatar Face-to-Face Conversation Video Generation},
author = {Yichao Yan and Zanwei Zhou and Zi Wang and Jingnan Gao and Xiaokang Yang},
journal= {arXiv preprint arXiv:2203.07931},
year = {2023}
}