中文

GenLCA:从真实场景视频中生成全身虚拟化身的三维扩散模型

计算机视觉与模式识别 2026-04-10 v2

摘要

我们提出GenLCA,一种基于扩散的生成模型,可从文本和图像输入生成和编辑照片级真实感的全身虚拟化身。生成的虚拟化身忠实于输入,同时支持高保真面部和全身动画。其核心思想是一种新颖的范式,允许从部分可观测的二维数据训练全身三维扩散模型,使训练数据集可扩展至数百万个真实世界视频。这种可扩展性有助于GenLCA优越的照片级真实感和泛化能力。具体而言,我们通过将预训练的前馈虚拟化身重建模型用作可动画化的三维标记器来扩展数据集,该标记器将非结构化视频帧编码为结构化三维标记。然而,大多数真实世界视频仅提供身体部位的部分观测,导致三维标记中出现过度模糊或透明伪影。为解决此问题,我们提出一种新颖的可见性感知扩散训练策略,用可学习标记替换无效区域,并仅在有效区域上计算损失。随后,我们在标记数据集上训练基于流的扩散模型,本质地保持了预训练虚拟化身重建模型提供的照片级真实感和可动画性。我们的方法有效实现了利用大规模真实世界视频数据在三维中原生训练扩散模型。我们通过多样且高保真的生成和编辑结果展示了该方法的有效性,大幅超越现有方案。项目页面位于https://onethousandwu.com/GenLCA-Page。

关键词

引用

@article{arxiv.2604.07273,
  title  = {GenLCA: 3D Diffusion for Full-Body Avatars from In-the-Wild Videos},
  author = {Yiqian Wu and Rawal Khirodkar and Egor Zakharov and Timur Bagautdinov and Lei Xiao and Zhaoen Su and Shunsuke Saito and Xiaogang Jin and Junxuan Li},
  journal= {arXiv preprint arXiv:2604.07273},
  year   = {2026}
}