中文

VQTalker:通过面部运动分词实现多语言说话化身

计算机视觉与模式识别 2024-12-19 v2

摘要

我们提出了 VQTalker—a 基于向量量化的框架,用于多语言说话头生成,解决面部同步与跨语言自然运动的挑战。我们的做法基于人类语音由有限离散声单元 (phoneme) 和相应视觉描绘 (viseme) 组成且在不同语言中常共享特征的原则。我们引入基于群残差离散标量量化 (GRFSQ) 的面部运动分词器,创建面部特征的离散表示。该方法实现了对面部运动的全面捕获,同时提高了对多语言情境的泛化能力,即便在训练数据有限时亦可。建立在该离散表示之上的,我们实现了粗到细的运动生成过程,逐步细化面部动画。广泛实验表明,VQTalker 在视频驱动和语音驱动情境下均实现了状态最先进性能,尤其在多语言情境中表现突出。值得注意的是,我们的方法在 512×512 分辨率下实现了高质量结果,同时保持约 11 kbps 的较低比特率。我们的工作为跨语言说话面脸生成开辟了新可能。合成结果可在 https://x-lance.github.io/VQTalker 查看。

关键词

引用

@article{arxiv.2412.09892,
  title  = {VQTalker: Towards Multilingual Talking Avatars through Facial Motion Tokenization},
  author = {Tao Liu and Ziyang Ma and Qi Chen and Feilong Chen and Shuai Fan and Xie Chen and Kai Yu},
  journal= {arXiv preprint arXiv:2412.09892},
  year   = {2024}
}

备注

14 pages