通过桥扩散实现统一潜空间中的联合几何-外观人类重建
计算机视觉与模式识别
2026-01-05 v1
摘要
从单个 RGB 图像实现 3D 数字人类一致且高保真的几何与外观重建是 inherently 一个具有挑战性的任务。现有研究通常采用解耦的管道进行几何估计和外观合成,往往阻碍统一重建并导致不一致。本文引入了 JGA-LBD(Joint Geometry-Appearance via Bridge Diffusion),一个新型框架,将几何和外观建模统一到联合潜表示中,并将生成过程形式化为桥扩散。观察到直接整合异构输入条件(如深度图、SMPL 模型)会导致显著训练困难,我们将所有条件统一到 3D 高斯表示中,该表示可通过共享稀疏变分自编码器(VAE)进一步压缩到统一潜空间中。随后,桥扩散的专用形式使我们能够从目标潜代码的部分观察开始,仅聚焦于推断缺失的组件。最后,一个专门的解码模块从推断得到的潜表示中提取完整的 3D 人类几何结构并渲染新视图。实验表明,JGA-LBD 在几何保真度和外观质量方面均优于当前的领先方法,包括具有挑战性的野外场景。我们的代码将在 https://github.com/haiantyz/JGA-LBD 上公开发布。
引用
@article{arxiv.2601.00328,
title = {Joint Geometry-Appearance Human Reconstruction in a Unified Latent Space via Bridge Diffusion},
author = {Yingzhi Tang and Qijian Zhang and Junhui Hou},
journal= {arXiv preprint arXiv:2601.00328},
year = {2026}
}