中文

FlexAvatar:用于带详细变形的可动画高质量 3D 头像的灵活大型重建模型

计算机视觉与模式识别 2025-12-22 v1

摘要

我们提出 FlexAvatar,一种从单张或稀疏图像中生成高保真 3D 头像并支持详细动态变形的灵活大型重建模型,无需摄像机位姿或表情标签。它利用基于 Transformer 的重建模型,借助结构化的头部查询 token 作为规范锚点,将灵活的、无关输入数量、无摄像机位姐且无表情的输入聚合成稳健的 3D 规范表示。为实现详细的动态变形,我们引入基于 UV 空间位置图的轻量级 UNet 解码器,可实时生成与表情相关的细节变形。为更好地捕捉如皱纹和露齿等罕见但关键的表情,在训练期间采用数据分布调整策略以平衡这些表情在训练集中的分布。此外,还可在不影响变形质量的前提下,对极端身份进行 10 秒级的轻量级精炼,以进一步提升身份特性细节。广泛的实验表明,FlexAvatar 在 3D 一致性和动态逼真度方面优于先前方法,为可动画 3D 头像创建提供了实用解决方案。

关键词

引用

@article{arxiv.2512.17717,
  title  = {FlexAvatar: Flexible Large Reconstruction Model for Animatable Gaussian Head Avatars with Detailed Deformation},
  author = {Cheng Peng and Zhuo Su and Liao Wang and Chen Guo and Zhaohu Li and Chengjiang Long and Zheng Lv and Jingxiang Sun and Chenyangguang Zhang and Yebin Liu},
  journal= {arXiv preprint arXiv:2512.17717},
  year   = {2025}
}

备注

Project page: https://pengc02.github.io/flexavatar