VoluMe——基于实时高斯泼溅预测的真实3D视频通话
计算机视觉与模式识别
2025-07-30 v1 图形学
摘要
与标准的2D视频通话相比,虚拟3D会议有潜力增强共在感、提高参与度,从而提升远程会议的效果。然而,在3D会议中呈现人物仍然是一个挑战;现有解决方案通过使用复杂硬件、利用注册固定外观或反转预训练生成模型来实现高质量。这些方法导致了视频会议应用中不受欢迎且不合适的限制。我们提出了第一种方法,能够从单个2D网络摄像头输入实时预测3D高斯重建,该3D表示不仅是实时的、逼真的,而且对输入视频是保真的。通过独立地基于每个视频帧来条件化3D表示,我们的重建忠实地再现了从捕获视角看到的输入视频(我们称之为保真性的性质),同时能逼真地泛化到新视角。此外,我们引入了一个稳定性损失,以获得在视频序列上时间稳定的重建。我们表明,与现有方法相比,我们的方法在视觉质量和稳定性指标上达到了最先进的精度,并仅使用标准的2D摄像头和显示器在实时的一对一3D会议中演示了我们的方法。这表明,我们的方法可以让任何人通过一种不仅高度可及,而且逼真且保真的3D视频会议方法进行体三维通信。
引用
@article{arxiv.2507.21311,
title = {VoluMe -- Authentic 3D Video Calls from Live Gaussian Splat Prediction},
author = {Martin de La Gorce and Charlie Hewitt and Tibor Takacs and Robert Gerdisch and Zafiirah Hosenie and Givi Meishvili and Marek Kowalski and Thomas J. Cashman and Antonio Criminisi},
journal= {arXiv preprint arXiv:2507.21311},
year = {2025}
}