中文

LinguaLinker:基于隐式面部控制增强的音频驱动人物动画

计算机视觉与模式识别 2024-07-29 v1

摘要

本研究深入探讨了在多语言音频输入之间同步面部动态的细节,聚焦于通过扩散技术创建具有视觉冲击力且时间同步的动画。与传统基于参数的人脸动画模型不同,我们提出的一种方法——LinguaLinker,采用一种整体性的扩散框架,集成音频驱动的视觉合成,以增强听觉刺激与视觉响应之间的协同性。我们独立处理音频特征,推导出对应的控制门,这些控制门隐式地支配口部、眼部和头部的运动,无论其人物来源如何。先进的音频驱动视觉合成机制提供了细致的控制,同时保持了输出视频与输入音频的兼容性,使得能够更精准、有效地表现不同语言中不同人物的独特性。我们方法在人物动画保真度提升、唇音同步准确性以及运动变体的适当性方面均取得显著改进,使其成为一种灵活的工具,可用于以任何语言动画化任何人物。

关键词

引用

@article{arxiv.2407.18595,
  title  = {LinguaLinker: Audio-Driven Portraits Animation with Implicit Facial Control Enhancement},
  author = {Rui Zhang and Yixiao Fang and Zhengnan Lu and Pei Cheng and Zebiao Huang and Bin Fu},
  journal= {arXiv preprint arXiv:2407.18595},
  year   = {2024}
}