中文

DualTalker:一种用于语音驱动三维面部动画的跨模态双重学习框架

计算机视觉与模式识别 2023-11-14 v2

摘要

近年来,音频驱动的三维面部动画受到显著关注,尤其在虚拟现实、游戏和视频会议等应用中。然而,精确建模面部表情复杂而细微的动态仍具挑战。多数现有研究将面部动画任务视为单一回归问题,往往未能捕捉语音信号与三维面部动画之间内在的跨模态关系,并忽视了二者固有的一致性。此外,由于三维音视觉数据集的有限可用性,基于小样本学习的方法泛化性差,导致性能下降。为解决这些问题,本研究提出一种跨模态双重学习框架,称为 DualTalker,旨在提升数据使用效率并建立跨模态依赖关系。该框架以主任务(音频驱动面部动画)及其对偶任务(唇读)联合训练,并共享通用的音频/运动编码器组件。我们的联合训练框架通过利用两任务的信息并显式发挥面部运动与音频间的互补关系来提升性能,从而实现更高效的数据使用。此外,我们引入辅助跨模态一致性损失,以缓解跨模态互补表示中潜在的过度平滑问题,增强对细微面部表情动态的映射。通过在 VOCA 和 BIWI 数据集上开展的广泛实验与感知用户研究,我们证明所提方法在定性与定量上均优于当前最先进方法。我们已在 https://github.com/sabrina-su/iadf.git 公开代码与视频演示。

关键词

引用

@article{arxiv.2311.04766,
  title  = {DualTalker: A Cross-Modal Dual Learning Approach for Speech-Driven 3D Facial Animation},
  author = {Guinan Su and Yanwu Yang and Zhifeng Li},
  journal= {arXiv preprint arXiv:2311.04766},
  year   = {2023}
}