中文

Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation

计算机视觉与模式识别 2026-05-26 v1 图形学 机器人学

摘要

高保真 3D 高斯头像生成是 AR/VR、远端会话和数字人等应用的关键技术。现有方法依赖多视角数据集、3D 捕获或中间 2D 视图合成。相反,我们仅使用随机采样的 2D 图像即可学习条件和无条件 3D 头部模型,而无需多视角数据、3D 监督或中间视图生成。我们引入MVCHead,一个单次-shot 状态空间模型,通过在 3D 表示中直接强制执行多视角一致性(MVC)来实现 3D 高斯的回归。其核心是提出的层次化状态空间(HiSS)模块,可从粗到细逐步细化高斯,同时捕获长程依赖。在每个 HiSS 模块中,我们修改 Mamba 的标准单向扫描,采用提出的层次化双向状态扫描(HiBiSS),以最强的多视角不一致方向为轴向进行扫描。最后,我们设计了一个 SE(3) 多视角评论者,对一组自渲染结果进行评判,以判断其是否来自单一底层 3D 配置,从而在不观察真实多视角对的前提下奖励跨视图像素对齐。MVCHead 实现了最新的感知质量,净响 surpasses 现有方法在纹理和几何一致性方面,并保持可比的形状一致性。为展示可扩展性,我们发布了 FaceGS-10K,首个规模大且即插即用的数据集,适用于训练和评估 3D 头部模型。项目页面和代码:https://humansensinglab.github.io/MVCHead/

关键词

引用

@article{arxiv.2605.25220,
  title  = {Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation},
  author = {Aviral Chharia and Fernando De la Torre},
  journal= {arXiv preprint arXiv:2605.25220},
  year   = {2026}
}

备注

CVPR 2026; Project Website: https://humansensinglab.github.io/MVCHead/