中文

超越固定拓扑:未注册训练和3D说话人头的全面评估指标

计算机视觉与模式识别 2026-01-09 v3

摘要

生成语音驱动的3D说话人头存在诸多挑战;其中之一是处理网格拓扑变化,模型无法在网格之间进行点对对应。以往的文献工作假设固定的网格结构,而在本 work 中,我们提出首个能够对任意拓扑的3D面部进行动画的框架,包括真实扫描数据。我们的方法利用热扩散来预测对网格拓扑鲁棒的特征。我们探讨两种训练设置:一种是注册的设置,在该设置中,训练序列中的网格共享固定拓扑,但可在测试时对任意网格进行动画;另一种是完全未注册的设置,允许在具有不同网格结构的情况下有效训练。此外,我们指出当前评估指标的局限性,提出新的指标以获得更好的唇同步评估。广泛的评估显示,我们的方法在固定拓扑技术方面表现优异,通过提供不受拓扑约束的通用且高保真度3D说话人头解答方案,设立了新的基准。代码及预训练模型均已提供。

关键词

引用

@article{arxiv.2410.11041,
  title  = {Beyond Fixed Topologies: Unregistered Training and Comprehensive Evaluation Metrics for 3D Talking Heads},
  author = {Federico Nocentini and Thomas Besnier and Claudio Ferrari and Sylvain Arguillere and Mohamed Daoudi and Stefano Berretti},
  journal= {arXiv preprint arXiv:2410.11041},
  year   = {2026}
}

备注

https://fedenoce.github.io/scantalk/