中文

Mon3tr:基于高斯 avatar 的单目 3D 全息肉体

计算机视觉与模式识别 2026-01-13 v1 人工智能

摘要

沉浸式全息肉体旨在通过实现增强远程协作的逼真全身全息表示来改变 AR/VR 应用中的人类交互方式。然而,现有系统依赖于硬件密集型的多摄像机设置,并需要高带宽进行体积流式传输,限制了其在移动设备上的实时性能。为克服这些挑战,我们提出了 Mon3tr,一种新型单目 3D 全息框架,首次将基于 3D 高斯溶解(3DGS)的参数化人类建模集成到全息肉体中。Mon3tr 采用摊销计算策略,将过程分为一次性离线多视角重建阶段以构建用户特定的 avatar,以及在实时全息会话期间的单目在线推断阶段。使用单个单目 RGB 摄像机实时捕获身体动作和面部表情,以驱动 3DGS 参数化人类模型,显著降低了系统复杂度和成本。提取的运动和外观特征通过 WebRTC 数据通道以 < 0.2 Mbps 的速率传输,允许在网络波动时进行稳健适应。在接收端,例如 Meta Quest 3,我们开发了一个轻量级 3DGS 属性变形网络,用于动态生成 pre-built avatar 的纠正性 3DGS 属性调整,在约 60 FPS 的速度下合成逼真的运动和外观。广泛的实验表明,我们的方法在性能上实现了业界水平,实现了 novel poses 下的 PSNR > 28 dB,端到端延迟约 80 ms,带宽比点云流式传输降低了 > 1000 倍,同时支持来自单目输入的实时操作,适用于多种场景。我们的演示可在 https://mon3tr3d.github.io 查看。

关键词

引用

@article{arxiv.2601.07518,
  title  = {Mon3tr: Monocular 3D Telepresence with Pre-built Gaussian Avatars as Amortization},
  author = {Fangyu Lin and Yingdong Hu and Zhening Liu and Yufan Zhuang and Zehong Lin and Jun Zhang},
  journal= {arXiv preprint arXiv:2601.07518},
  year   = {2026}
}