TeRA:重新思考基于文本指导的真实3D头像生成
计算机视觉与模式识别
2025-09-04 v1
摘要
本文我们重新思考基于文本的3D头像生成模型,提出TeRA—a 相较于先前基于SDS的模型和通用大型3D生成模型更高效更有效的框架。我们的方法采用两阶段训练策略,以学习本机3D头像生成模型。初始阶段,我们通过蒸馏解码器从大型人类重建模型中获得结构化潜在空间。随后,训练一个受文本控制的潜在扩散模型,以在该潜在空间内生成逼真的3D人类头像。TeRA通过消除缓慢的迭代优化,实现了模型性能的提升,并通过结构化的3D人类表示实现了基于文本的局部定制。实验结果表明,我们的方法在主观和客观评估方面优于先前的文本到头像生成模型。
引用
@article{arxiv.2509.02466,
title = {TeRA: Rethinking Text-guided Realistic 3D Avatar Generation},
author = {Yanwen Wang and Yiyu Zhuang and Jiawei Zhang and Li Wang and Yifei Zeng and Xun Cao and Xinxin Zuo and Hao Zhu},
journal= {arXiv preprint arXiv:2509.02466},
year = {2025}
}
备注
Accepted by ICCV2025