面向视频到语音合成的大规模无监督音频预训练
声音
2024-10-28 v2 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
视频到语音合成是从说话人静音视频中重建语音信号的任务。迄今多数成熟方法采用两步流程:先从视频提取中间表示(如谱图),再送入声码器生成原始音频。近期部分研究聚焦于端到端合成,即原始音频与任何中间表示的生成联合进行。此类方法均在几乎仅含音视频的数据集上训练,即每个音频样本都有对应视频样本。这排除了使用丰富的纯音频数据集(可能无对应视觉模态,如有声书、广播播客、语音识别数据集等),以及音频机器学习界多年来发展的纯音频架构。本文提出在24kHz、超3500小时音频数据上训练编码器-解码器模型,再用预训练解码器初始化视频到语音合成任务的音频解码器。预训练步骤仅用音频样本,无需标签或其他模态(视觉、文本)的对应样本。我们证明该预训练步骤改善了重建语音,且是跨模态任务中提升生成器质量却仅需单模态样本的这一未被探索的途径。我们以原始音频与梅尔谱图为目标输出开展实验,并与已有工作基准比较。
引用
@article{arxiv.2306.15464,
title = {Large-scale unsupervised audio pre-training for video-to-speech synthesis},
author = {Triantafyllos Kefalas and Yannis Panagakis and Maja Pantic},
journal= {arXiv preprint arXiv:2306.15464},
year = {2024}
}
备注
Corrected typos. This work has been submitted to the IEEE for possible publication