中文

ScanTalk:从未注册扫描数据生成 3D 说话人头

计算机视觉与模式识别 2024-09-26 v3

摘要

语音驱动的 3D 说话人头生成一直是研究人员关注的热点领域,面临诸多挑战。现有方法受限于固定拓扑结构的人脸动画,需在点之间建立对应关系,且点的数量和顺序在所有可动画身份中保持一致。本文提出了 ScanTalk—a 一种能够对任意拓扑结构(包括扫描数据)进行 3D 人脸动画的新型框架。我们的方法依赖 DiffusionNet 架构,以克服固定拓扑限制,为更灵活、更真实的 3D 动画提供了可行路径。通过 DiffusionNet 的强大功能,ScanTalk 不仅能够适应多样化的面部结构,还能在处理扫描数据时保持细节保真,从而提升生成 3D 说话人头的真实性和通用性。通过与最新方法的全面比较,我们验证了该方法的有效性,表明其能够生成与现有技术相当的逼真说话人头。虽然本文的主要目标是开发一种无需拓扑约束的通用方法,但所有最新方法都受制于此类限制。用于复现我们结果的代码和预训练模型已提供,地址为 https://github.com/miccunifi/ScanTalk 。

关键词

引用

@article{arxiv.2403.10942,
  title  = {ScanTalk: 3D Talking Heads from Unregistered Scans},
  author = {Federico Nocentini and Thomas Besnier and Claudio Ferrari and Sylvain Arguillere and Stefano Berretti and Mohamed Daoudi},
  journal= {arXiv preprint arXiv:2403.10942},
  year   = {2024}
}

备注

Published in the ECCV 2024 Proceedings