用于合成照片级真实虚拟新闻主播的神经唇形同步框架
计算机视觉与模式识别
2021-05-06 v2 音频与语音处理
摘要
唇形同步已成为一种从音频信号生成嘴部运动的有前景的技术。然而,合成高分辨率且照片级真实的虚拟新闻主播仍具挑战性。缺乏自然外观、视觉一致性和处理效率是现有方法的主要问题。本文提出一种专为生成高保真虚拟新闻主播设计的新型唇形同步框架。使用一对时序卷积网络学习从音频信号到嘴部运动的跨模态序列映射,随后由一个神经渲染网络将合成面部图转换为高分辨率且照片级真实的外观。该全可训练框架提供端到端处理,在许多低延迟应用中优于传统基于图形的方法。实验还表明,该框架在视觉外观和效率方面均优于现代基于神经网络的方法。
引用
@article{arxiv.2002.08700,
title = {A Neural Lip-Sync Framework for Synthesizing Photorealistic Virtual News Anchors},
author = {Ruobing Zheng and Zhou Zhu and Bo Song and Changjiang Ji},
journal= {arXiv preprint arXiv:2002.08700},
year = {2021}
}
备注
Accepted by ICPR2020