uSee:基于条件扩散模型的统一语音增强与编辑
声音
2023-10-03 v1 人工智能
计算与语言
音频与语音处理
摘要
语音增强旨在从质量和可懂度方面改善语音信号,而语音编辑是指根据用户特定需求对语音进行编辑的过程。在本文中,我们提出了一种基于条件扩散模型的统一语音增强与编辑(uSee)模型,以生成式方式同时处理多种任务。具体而言,通过向基于得分的扩散模型提供包括自监督学习嵌入和恰当文本提示在内的多种条件,我们能够实现统一语音增强与编辑模型的可控生成,从而对源语音执行相应操作。我们的实验表明,与其他相关生成式语音增强模型相比,我们提出的 uSee 模型在语音去噪和去混响方面均取得了更优性能,并且能够根据所需环境声音文本描述、信噪比(SNR)和房间脉冲响应(RIR)进行语音编辑。生成语音的演示可在 https://muqiaoy.github.io/usee 获取。
引用
@article{arxiv.2310.00900,
title = {uSee: Unified Speech Enhancement and Editing with Conditional Diffusion Models},
author = {Muqiao Yang and Chunlei Zhang and Yong Xu and Zhongweiyang Xu and Heming Wang and Bhiksha Raj and Dong Yu},
journal= {arXiv preprint arXiv:2310.00900},
year = {2023}
}