学习语音上下文相关的视位以增强语音驱动的3D面部动画
计算机视觉与模式识别
2025-08-12 v2 人工智能
摘要
语音驱动的3D面部动画旨在生成与音频同步的真实面部运动。传统方法主要通过将每一帧与真实值对齐来最小化重建损失。然而,这种逐帧方法通常无法捕捉面部运动的连续性,由于协同发音导致输出抖动且不自然。为解决此问题,我们提出一种新颖的语音上下文感知损失函数,该函数显式建模语音上下文对视位过渡的影响。通过引入视位协同发音权重,我们根据面部运动随时间的变化动态变化为其分配自适应重要性,确保动画更平滑且感知上一致。大量实验表明,用我们的损失函数替换传统的重建损失可改善定量指标和视觉质量。这凸显了在合成自然的语音驱动3D面部动画时,显式建模语音上下文相关视位的重要性。项目页面:https://cau-irislab.github.io/interspeech25/
引用
@article{arxiv.2507.20568,
title = {Learning Phonetic Context-Dependent Viseme for Enhancing Speech-Driven 3D Facial Animation},
author = {Hyung Kyu Kim and Hak Gu Kim},
journal= {arXiv preprint arXiv:2507.20568},
year = {2025}
}
备注
Interspeech 2025; Project Page: https://cau-irislab.github.io/interspeech25/