V2SFlow:基于语音分解和曲线流的视频到语音生成
计算机视觉与模式识别
2025-06-02 v2 声音
音频与语音处理
摘要
本文介绍了 V2SFlow,一种新的视频到语音(Video-to-Speech,V2S)框架,旨在直接从静默说话人脸视频生成自然且易于理解的语音。虽然最近的 V2S 系统在带有限说话者和词汇量的受限数据集上显示出有前景的结果,但其在现实世界、非受限数据集上的性能常因语音信号的固有变异性和复杂性而下降。为解决这些挑战,我们将语音信号分解为可管理的子空间(内容、基调和说话人信息),每个子空间代表不同的语音属性,并直接从视觉输入预测这些属性。为生成来自这些预测属性的连贯且真实的语音,我们采用基于 Transformer 架构的曲线流匹配解码器,模型化从随机噪声到目标语音分布的高效概率路径。大量实验表明,V2SFlow 显著优于现有方法,甚至超过了基准语音的自然度。代码和模型均可在 https://github.com/kaistmm/V2SFlow 获取。
关键词
引用
@article{arxiv.2411.19486,
title = {V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow},
author = {Jeongsoo Choi and Ji-Hoon Kim and Jinyu Li and Joon Son Chung and Shujie Liu},
journal= {arXiv preprint arXiv:2411.19486},
year = {2025}
}
备注
ICASSP 2025