VOODOO XP:面向VR远程会话的表达性单镜头头部重作
计算机视觉与模式识别
2024-05-29 v2 人工智能
图形学
摘要
我们介绍VOODOO XP:一种3D感知的单镜头头部重作方法,可从任意输入驱动视频和单个2D肖像生成高度表达性的面部表情。我们的解决方案实时、视图一致,可无需校准或微调即可立即使用。我们在单目视频设置和面向双向通信的端到端VR远程会话系统上展示了我们的解决方案。与2D头部重作方法相比,3D感知方法旨在保留主体身份并确保新相机姿态下的视图一致面部几何,这使其适用于沉浸式应用。虽然已介绍各种面部解缝技术,但最新的3D感知神经重作技术仍缺乏表达性,无法复现复杂和细粒度的面部表情。我们提出了一种新的跨重作架构,直接将驱动人的面部表情传递到输入源3D升压模块的Transformer块中。我们展示了使用创新的多阶段自监督方法(基于粗到细策略)结合显式面部中性化和3D升压正面化进行初始训练,即可实现高度有效的解缝。我们进一步将新的头部重作解决方案集成到一个易于访问的高保真VR远程会话系统中,该系统允许任何人从任何照片中立即构建个人神经头部头像并通过VR设备赋予其生命。我们在大量多样化主体和捕获条件上展示了该方法在表达性和似然性保持方面的领先性能。
引用
@article{arxiv.2405.16204,
title = {VOODOO XP: Expressive One-Shot Head Reenactment for VR Telepresence},
author = {Phong Tran and Egor Zakharov and Long-Nhat Ho and Liwen Hu and Adilbek Karmanov and Aviral Agarwal and McLean Goldwhite and Ariana Bermudez Venegas and Anh Tuan Tran and Hao Li},
journal= {arXiv preprint arXiv:2405.16204},
year = {2024}
}