DeepAudio-V1:面向多模态多阶段端到端视频到语音与音频生成
计算机视觉与模式识别
2025-03-31 v1 声音
音频与语音处理
摘要
当前,采用各种多模态联合学习框架,利用视频和可选文本输入,合成高质量同步音频。在视频到音频基准中,实现了视频到音频质量、语义对齐和音频视觉同步。然而,在实际场景中,语音和音频常常同时存在于视频中,给定视频和文本条件下同步语音和音频的端到端生成尚未得到良好研究。因此,我们提出一种端到端的多模态生成框架,能够基于视频和文本条件同时生成语音和音频。此外,视频到音频(V2A)模型用于从视频生成语音的优势尚不明确。我们提出的框架DeepAudio由视频到音频(V2A)模块、文本到语音(TTS)模块和动态模态混合(MoF)模块组成。在评估方面,所提出的端到端框架在视频音频基准、视频语音基准和文本语音基准上实现了最先进的性能。具体而言,我们的框架在比较中与最先进模型在视频音频和文本语音基准上取得相当的结果,在视频语音基准上超越了最先进模型,分别在各种 dubbing 设置下实现了 WER 16.57% 到 3.15%(+80.99%)、SPK-SIM 78.30% 到 89.38%(+14.15%)、EMO-SIM 66.24% 到 75.56%(+14.07%)、MCD 8.59 到 7.98(+7.10%)、MCD SL 11.05 到 9.40(+14.93%)。
引用
@article{arxiv.2503.22265,
title = {DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation},
author = {Haomin Zhang and Chang Liu and Junjie Zheng and Zihao Chen and Chaofan Ding and Xinhan Di},
journal= {arXiv preprint arXiv:2503.22265},
year = {2025}
}
备注
11 pages, 5 figures