中文

基于合成输入音频的音视频视频到语音合成

声音 2024-10-28 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

视频到语音合成旨在从无声视频中重建说话人的语音信号。该任务的隐含假设是声音信号要么缺失,要么含有大量噪声/损坏以至于无法用于处理。文献中已有工作仅使用视频输入,或在训练时同时使用视频与音频输入、而在推理时丢弃音频输入通路。本工作中,我们探究在训练与推理阶段均使用视频与音频输入进行视频到语音合成的效果。具体而言,我们使用预训练的视频到语音模型合成缺失的语音信号,然后训练一个音视频到语音合成模型,以无声视频与合成语音为输入,预测最终重建的语音。我们的实验表明,该方法在以原始波形与 mel 谱图为目标输出时均取得成功。

关键词

引用

@article{arxiv.2307.16584,
  title  = {Audio-visual video-to-speech synthesis with synthesized input audio},
  author = {Triantafyllos Kefalas and Yannis Panagakis and Maja Pantic},
  journal= {arXiv preprint arXiv:2307.16584},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication