FreeTalk:情感拓扑无关的 3D 说话人头
计算机视觉与模式识别
2026-03-17 v1
摘要
语音驱动的 3D 人脸动画取得了快速进展,但大多数方法仍依赖于已注册的模板网格,无法有效部署在原始 3D scan 上且拓扑任意。同时,建模模板参数化之外的可控情感动力学仍具有挑战性,往往与模板方法相关。我们通过提出 FreeTalk 来解决这些挑战,这是一个针对情感条件的 3D 说话人头动画的 two-stage 框架,可推广到未注册的人脸网格且顶点数和连通性任意。首先,Audio-To-Sparse (ATS) 从语音音频中预测一系列时序一致的 3D 地标位移,条件为情感类别和强度。这种稀疏表示同时捕获了语音和情感运动,同时独立于网格拓扑。其次,Sparse-To-Mesh (STM) 将预测的地标运动传输到目标网格上,通过结合内在表面特征与地标到顶点条件,产生密集的 per-vertex 变形,无需模板匹配或 test 时间的对应关系监督。广泛的实验表明,FreeTalk 在 in-domain 训练时与专门的基线相当,而在面对未见身份和网格拓扑时提供了显著更好的鲁棒性。代码和预训练模型将公开提供。
引用
@article{arxiv.2603.15512,
title = {FreeTalk: Emotional Topology-Free 3D Talking Heads},
author = {Federico Nocentini and Thomas Besnier and Claudio Ferrari and Stefano Berretti and Mohamed Daoudi},
journal= {arXiv preprint arXiv:2603.15512},
year = {2026}
}