从面部到声音:学习层次表示以实现高品质视频转语音
音频与语音处理
2025-03-24 v1 人工智能
计算机视觉与模式识别
声音
摘要
本研究的目标是生成来自无声说话人脸视频的高质量语音,这一任务也称为视频转语音合成。在视频转语音合成中,一个显著挑战在于静默视频与多维语音之间的模态差距。本文提出了一种新型的视频转语音系统,通过学习从视频到语音的层次表示,有效弥合了这一模态差距,显著提升了合成语音的质量。具体而言,我们通过三个连续阶段——内容、声纹和韵律建模——逐步将静默视频转换为声学特征空间。在每个阶段,我们将视觉因素(唇部运动、面部身份和面部表情)与相应的声学因素对齐,以确保转换过程的顺畅。此外,为了生成来自视觉表示的真实且连贯的语音,我们采用流匹配模型(flow matching model),其估计从简单先验分布到目标语音分布的直接轨迹。大量实验表明,我们的方法在生成质量方面取得卓越的成绩,与真实语音相当,显著优于现有方法。
引用
@article{arxiv.2503.16956,
title = {From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech},
author = {Ji-Hoon Kim and Jeongsoo Choi and Jaehun Kim and Chaeyoung Jung and Joon Son Chung},
journal= {arXiv preprint arXiv:2503.16956},
year = {2025}
}
备注
CVPR 2025, demo page: https://mm.kaist.ac.kr/projects/faces2voices/