使用高斯溅射动画化场景中的人类头像
计算机视觉与模式识别
2026-01-06 v2
摘要
我们提出了一种用于在 3D 场景中动画化人类的新型框架,基于 3D 高斯溅射 (3DGS),这是一种最近在新视角合成中实现了最先进的照片实时结果的神经场景表示,但在人类-场景动画和交互方面仍未得到充分探索。与现有使用网格或点云作为底层 3D 表示的动画管道不同,我们的方法引入了将 3DGS 作为人类在场景中动画化的 3D 表示。通过将人类和场景表示为高斯,我们的方法允许对人类与 3D 场景交互进行几何一致的自由视角渲染。我们的关键洞察是,渲染可以独立于运动合成进行处理,每个子问题都可以单独解决,而无需配对的人类-场景数据。我们方法的核心是高斯对齐运动模块,通过不使用显式场景几何,而是利用基于不透明度的线索和投影高斯结构来指导人类放置和姿态对齐。为确保自然交互,我们进一步提出了人类-场景高斯细化优化,以实现真实的接触和导航。我们在来自 Scannet++ 和 SuperSplat 库的场景上进行评估,并在来自稀疏和密集多视角人类捕获的头像上进行测试。最后,我们展示了该框架使我们能够实现诸如将编辑后的单目 RGB 视频中的新动画化人类进行几何一致的自由视角渲染等新应用,展示了 3DGS 对于单目视频基于人类的动画的独特优势。为评估结果的完整质量,我们鼓励读者查看可在 https://miraymen.github.io/aha/ 上获得的补充材料。
引用
@article{arxiv.2511.09827,
title = {AHA! Animating Human Avatars in Diverse Scenes with Gaussian Splatting},
author = {Aymen Mir and Jian Wang and Riza Alp Guler and Chuan Guo and Gerard Pons-Moll and Bing Zhou},
journal= {arXiv preprint arXiv:2511.09827},
year = {2026}
}
备注
Project page available at: https://miraymen.github.io/aha/