中文

TalkingEyes: 多元语音驱动的3D眼神动画

计算机视觉与模式识别 2026-01-06 v2

摘要

尽管语音驱动的3D面部动画领域近期取得了显著进展,但语音驱动的一个不可或缺的面部组件——眼神的动画,却被近期研究忽视了。这主要是由于语音与眼神之间的弱相关性,以及音频-眼神数据的稀缺性,使得仅从语音生成3D眼神运动极具挑战性。本文提出了一种新颖的数据驱动方法,能够生成与语音协调的多样化3D眼神运动。为此,我们首先构建了一个音频-眼神数据集,包含约14小时的音频-网格序列,同时具有高质量的眼神运动、头部运动和面部运动。运动数据是通过对现有音视频数据集中的视频进行轻量级眼神拟合和面部重建获得的。然后,我们定制了一个新颖的语音到运动转换框架,其中头部运动和眼神运动从语音联合生成,但在两个独立的潜在空间中建模。这一设计源于生理学知识:眼球的旋转范围小于头部。通过将语音嵌入映射到这两个潜在空间,语音与非言语运动之间弱相关性的建模难度得以降低。最后,我们的TalkingEyes与一个语音驱动的3D面部运动生成器集成,能够从语音中共同合成眼神运动、眨眼、头部运动和面部运动。大量的定量和定性评估证明了所提方法在从语音生成多样且自然的3D眼神运动方面的优越性。本文的项目页面为:https://lkjkjoiuiu.github.io/TalkingEyes_Home/

关键词

引用

@article{arxiv.2501.09921,
  title  = {TalkingEyes: Pluralistic Speech-Driven 3D Eye Gaze Animation},
  author = {Yixiang Zhuang and Chunshan Ma and Yao Cheng and Xuan Cheng and Jing Liao and Juncong Lin},
  journal= {arXiv preprint arXiv:2501.09921},
  year   = {2026}
}