中文

AvatarForge:用于生成可动画 3D 人类模型的多模态生成框架

计算机视觉与模式识别 2025-03-12 v1

摘要

我们介绍 AvatarForge,这是一个从文本或图像输入生成可动画 3D 人类头像的框架,利用 AI 驱动的程序化生成。虽然扩散方法在一般 3D 对象生成方面取得了进展,但由于人类身体形状、姿态的复杂性和多样性,加剧了高质量、可定制人类头像的稀缺数据问题。此外,对这些头像的动画化仍是现有方法面临的重大挑战。AvatarForge 通过将 LLM 基于常识的推理与即插即用的 3D 人类生成器相结合,实现对身体和面部细节的精细控制。不同于常常依赖预训练数据集且缺乏对 individual 人类特征精确控制的扩散模型,AvatarForge 提供了更灵活的方法,使人类能够纳入迭代设计和建模流程,其自动验证系统允许不断细化生成的头像,从而实现高精度和定制化。我们的评估显示,AvatarForge 在文本和图像到头像生成方面均优于前沿方法,成为艺术创作和动画的多用途工具。

关键词

引用

@article{arxiv.2503.08165,
  title  = {Multimodal Generation of Animatable 3D Human Models with AvatarForge},
  author = {Xinhang Liu and Yu-Wing Tai and Chi-Keung Tang},
  journal= {arXiv preprint arXiv:2503.08165},
  year   = {2025}
}