Wav2Sem: 面向 3D 语音驱动面部动画的即插即用音频语义解耦
声音
2025-05-30 v1 计算机视觉与模式识别
音频与语音处理
摘要
在 3D 语音驱动面部动画生成中,现有方法通常采用预训练的自监督音频模型作为编码器。然而,由于语言中存在发音相似但唇形不同的音节,这些近同音音节在自监督音频特征空间中往往表现出显著的耦合,导致后续唇部运动生成中出现平均效应。针对此问题,本文提出一种即插即用的语义解相关模块——Wav2Sem。该模块提取与整个音频序列对应的语义特征,利用附加的语义信息在特征空间内对音频编码进行解相关,从而获得更具表现力的音频特征。在多个语音驱动模型上的大量实验表明,Wav2Sem 模块能有效解耦音频特征,显著缓解发音相似音节在唇形生成中的平均效应,进而提升面部动画的精确度与自然度。我们的源代码可在 https://github.com/wslh852/Wav2Sem.git 获取。
引用
@article{arxiv.2505.23290,
title = {Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation},
author = {Hao Li and Ju Dai and Xin Zhao and Feng Zhou and Junjun Pan and Lei Li},
journal= {arXiv preprint arXiv:2505.23290},
year = {2025}
}
备注
Accepted to CVPR 2025