中文

SmartAvatar:基于 VLM AI 代理的文本和图像导向人类头像生成

计算机视觉与模式识别 2025-06-06 v1

摘要

SmartAvatar 是一个以视觉语言模型(VLM)为驱动的框架,能够从单张照片或文本提示生成完整 rig 好、准备好动画的 3D 人类头像。虽然扩散方法在一般 3D 对象生成方面取得了进展,但仍然难以控制人类身份、体型及动画就绪状态。与此不同,SmartAvatar 利用大型视觉语言模型(VLM)的常识推理能力,结合即插即用的参数化人类生成器,提供高质量、可定制的头像。其关键创新在于一个自主验证循环:代理程序渲染草稿头像,评估面部相似度、解剖学合理性和提示对齐情况,并不断调整生成参数以实现收敛。这种交互式、AI 导向的细化过程促进了对面部和身体特征的精细控制,使用户能够通过自然语言对话迭代细化自己的头像。与依赖静态预训练数据且灵活性有限的扩散模型不同,SmartAvatar 将用户纳入建模流程,通过基于 LLM 的程序化生成与验证系统实现持续改进。生成的头像完全 rig 好,支持姿态操作,保持身份和外观一致,适用于下游动画和交互应用。定量基准测试和用户研究表明,SmartAvatar 在重建网格质量、身份忠实度、属性准确性和动画就绪状态方面优于最近的文本和图像驱动头像生成系统,是面向消费级硬件的真实、可定制头像创建的多功能工具。

关键词

引用

@article{arxiv.2506.04606,
  title  = {SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents},
  author = {Alexander Huang-Menders and Xinhang Liu and Andy Xu and Yuyao Zhang and Chi-Keung Tang and Yu-Wing Tai},
  journal= {arXiv preprint arXiv:2506.04606},
  year   = {2025}
}

备注

16 pages