借助唇读专家的音视频指导提升语音驱动3D面部动画
计算机视觉与模式识别
2024-07-02 v1 图形学
摘要
语音驱动3D面部动画最近因其成本效益高的可用性而受到关注,但大多数当前进展忽视了唇部动作的可理解性,限制了面部表情的真实感。本文提出了一种方法,用于生成准确的唇部动作,提出了一种音视频多模态感知损失。该损失为训练生成与 spoken transcripts 对齐的合理唇部运动的语音驱动3D面部动画员提供了指导。此外,为融合所提出的音视频感知损失,我们构建了一个音视频唇读专家,利用其关于 speech 与唇部动作相关性的先验知识。我们通过广泛实验验证了该方法的有效性,显示在唇同步和唇可读性性能方面均有显著性改进。代码可在 https://3d-talking-head-avguide.github.io/ 查看。
引用
@article{arxiv.2407.01034,
title = {Enhancing Speech-Driven 3D Facial Animation with Audio-Visual Guidance from Lip Reading Expert},
author = {Han EunGi and Oh Hyun-Bin and Kim Sung-Bin and Corentin Nivelet Etcheberry and Suekyeong Nam and Janghoon Joo and Tae-Hyun Oh},
journal= {arXiv preprint arXiv:2407.01034},
year = {2024}
}
备注
INTERSPEECH 2024