GaussianMotion: 基于文本姿态引导的可动画 Gaussian 头像端到端学习
计算机视觉与模式识别
2025-02-18 v1
摘要
本文提出 GaussianMotion,一种新型人类渲染模型,通过 Gaussian Splatting 生成与文本描述对齐的全动画场景。虽然现有方法实现了对人类身体的文本到 3D 生成,但常面临保真度和效率限制,或主要关注静态模型且姿态控制有限。相比之下,我们的方法通过将可变形 3D Gaussian Splatting 与文本到 3D 意见蒸馏相结合,实现了任意姿态下高保真度和高效渲染。通过在优化期间密集生成多样随机姿态,我们的可变形 3D 人体模型能端到端学习捕捉来自姿态条件扩散模型的广泛自然动作。进一步,我们提出了自适应意见蒸馏,有效平衡真实细节与平滑度,以获得最佳 3D 结果。实验结果表明,我们的方法在静态和动画结果中均生成高质量纹理,并能从多样文本输入中生成多样化 3D 人体模型,显著优于现有基线方法。
关键词
引用
@article{arxiv.2502.11642,
title = {GaussianMotion: End-to-End Learning of Animatable Gaussian Avatars with Pose Guidance from Text},
author = {Gyumin Shim and Sangmin Lee and Jaegul Choo},
journal= {arXiv preprint arXiv:2502.11642},
year = {2025}
}
备注
8 pages