Polyglot:多语言风格保持的语音驱动面部动画
计算机视觉与模式识别
2026-04-20 v1
摘要
语音驱动面部动画(SDFA)因其在电影、电子游戏和虚拟现实中的应用而受到广泛关注。然而,大多数现有模型在单语言数据上训练,限制了它们在现实多语言场景中的有效性。在这项工作中,我们解决了多语言SDFA问题,这对于逼真的生成至关重要,因为语言影响语音、节奏、语调和面部表情。说话风格也受个体差异影响,而不仅仅受语言影响。现有方法通常依赖于特定语言或特定说话人的条件,但不能同时兼顾两者,限制了它们对两者交互建模的能力。我们引入了Polyglot,一种用于个性化多语言SDFA的统一扩散架构。我们的方法使用转录本嵌入来编码语言信息,并使用从参考面部序列中提取的风格嵌入来捕捉个体说话特征。Polyglot不需要预定义的语言或说话人标签,通过自监督学习实现跨语言和说话人的泛化。通过联合条件化语言和风格,它捕捉了诸如节奏、发音和习惯性面部动作等表达特征,产生时间连贯且逼真的动画。实验表明,在单语言和多语言设置中性能均有所提升,为在SDFA中建模语言和个人风格提供了一个统一框架。
引用
@article{arxiv.2604.16108,
title = {Polyglot: Multilingual Style Preserving Speech-Driven Facial Animation},
author = {Federico Nocentini and Kwanggyoon Seo and Qingju Liu and Claudio Ferrari and Stefano Berretti and David Ferman and Hyeongwoo Kim and Pablo Garrido and Akin Caliskan},
journal= {arXiv preprint arXiv:2604.16108},
year = {2026}
}
备注
The project website is available at https://fedenoce.github.io/polyglot/