中文

Generator-Refiner-Examiner:面向单目视频的3D人类头像学习的三模块数据增强框架

计算机视觉与模式识别 2026-05-25 v1

摘要

本文解决从单目视频重建光照逼真且可动画的3D人类头像的挑战。虽然现有方法依赖将per-subject优化与通用人类先验结合,但常常在训练帧数有限时无法捕获细粒度细节。为缓解数据稀缺问题,我们提出TrioMan,一个系统化的三模块框架用于增强3D头像学习。我们的方法由三个协同组件组成。Generator通过对姿态和相机施加高斯扰动来创建多样化的不可见样本。Refiner通过一个步骤的扩散引导纹理和几何线索改善生成数据的质量。Examiner使用双分支注意力基于相似性评估选择subject一致的样本。在X-Humans和NeuMan基准测试上实验表明,TrioMan在性能上优于最先进的方法。

关键词

引用

@article{arxiv.2605.23555,
  title  = {Generator-Refiner-Examiner: A Tri-Module Data Augmentation Framework for 3D Human Avatar Learning from Monocular Videos},
  author = {Gangjian Zhang and Jian Shu and Sicheng Yu and Wenhao Shen and Yu Feng and Hao Wang},
  journal= {arXiv preprint arXiv:2605.23555},
  year   = {2026}
}