中文

基于全局高斯场的few-shot身份适配3D说话人头

计算机视觉与模式识别 2025-06-30 v1

摘要

基于重建和渲染的说话人头合成方法在保持强身份辨识度方面取得高质量结果,但受限于对身份特定模型的依赖,每个新身份都需从头训练,计算成本高昂且可扩展性差。为此,我们提出FIAG—a一种新型3D说话人头合成框架,利用少量训练素材即可实现身份特定的高效适配。FIAG引入全局高斯场(Global Gaussian Field),支持在共享场中表示多个身份;同时采用通用运动场(Universal Motion Field),捕获跨身份间的通用运动动力学。得益于全局高斯场中编码的共享面部结构信息以及运动场中学习到的通用运动先验,我们的框架能够仅用极少数据,从标准身份表示快速适配到具体身份。大量对比和消融实验表明,我们的方法优于现有最先进方法,验证了所提框架的有效性与可泛化性。代码已公开:https://github.com/gme-hong/FIAG。

关键词

引用

@article{arxiv.2506.22044,
  title  = {Few-Shot Identity Adaptation for 3D Talking Heads via Global Gaussian Field},
  author = {Hong Nie and Fuyuan Cao and Lu Chen and Fengxin Chen and Yuefeng Zou and Jun Yu},
  journal= {arXiv preprint arXiv:2506.22044},
  year   = {2025}
}