通过跨模态解耦合成照片级真实虚拟人
计算机视觉与模式识别
2023-03-27 v2
摘要
过去几十年,人类生活的诸多方面因虚拟领域而增强,从 Amazon 的 Alexa 与 Apple 的 Siri 等数字助理的出现,到更名后的 Meta 最新的元宇宙尝试。这些趋势凸显了生成照片级真实人类视觉描绘的重要性。这导致近年来所谓的深度伪造与说话头部生成方法快速增长。尽管其结果令人印象深刻且广受欢迎,它们通常缺乏某些定性方面(如纹理质量、唇形同步或分辨率)以及实际方面(如实时运行能力)。为使虚拟人化身能用于实际场景,我们提出一种端到端框架,用于合成高质量、可准确唇动说话的虚拟人脸,并特别强调性能。我们引入一种利用视位作为中间音频表示的新颖网络,以及一种采用分层图像合成策略的新颖数据增强方法,该策略可解耦用于控制全局头部运动的不同模态。我们的方法可实时运行,并能比当前最先进水平(SOTA)给出更优结果。
引用
@article{arxiv.2209.01320,
title = {Synthesizing Photorealistic Virtual Humans Through Cross-modal Disentanglement},
author = {Siddarth Ravichandran and Ondřej Texler and Dimitar Dinev and Hyun Jae Kang},
journal= {arXiv preprint arXiv:2209.01320},
year = {2023}
}