SyncHuman:同步 2D 和 3D 生成模型用于单视图人类重建
计算机视觉与模式识别
2025-10-14 v2
摘要
从单张图像进行逼真的 3D 全身人类重建是电影和视频游戏等应用中的关键但具有挑战性的任务,由于固有的歧义和严重的自遮挡问题。虽然最近的方法利用 SMPL 估计和 SMPL-条件图像生成模型来幻视新视角,但它们受限于从 SMPL 网格估计的不准确 3D 先验,以及在处理困难人体姿势和重建细节方面的困难。本文提出SyncHuman,一种首次将 2D 多视图生成模型和 3D 原生生成模型结合的新型框架,使即使在挑战性人体姿势下,也能从单视图图像中实现高质量的衣着人类网格重建。多视图生成模型在捕捉细微 2D 细节方面优势显著,但在结构一致性方面存在挑战;而 3D 原生生成模型则生成粗糙但结构一致的 3D 形状。通过整合这两种方法的互补优势,我们开发了更有效的生成框架。具体而言,我们首先联合微调多视图生成模型和 3D 原生生成模型,采用提出的像素对齐 2D-3D 同步注意力机制,以产生几何对齐的 3D 形状和 2D 多视图图像。为进一步提高细节,我们引入特征注入机制,将 2D 多视图图像中的细微细节提升到对齐的 3D 形状上,实现准确且高保真的重建。广泛的实验表明,SyncHuman 实现了稳健且逼真的 3D 人类重建,即使针对具有挑战性姿势的图像亦可。我们的方法在几何精度和视觉保真度方面优于基线方法,显示出未来 3D 生成模型的有前景的方向。
引用
@article{arxiv.2510.07723,
title = {SyncHuman: Synchronizing 2D and 3D Generative Models for Single-view Human Reconstruction},
author = {Wenyue Chen and Peng Li and Wangguandong Zheng and Chengfeng Zhao and Mengfei Li and Yaolong Zhu and Zhiyang Dou and Ronggang Wang and Yuan Liu},
journal= {arXiv preprint arXiv:2510.07723},
year = {2025}
}
备注
NeurIPS 2025 https://xishuxishu.github.io/SyncHuman.github.io/