FINALLY: 具有录音室级质量的快速通用语音增强
声音
2024-11-01 v3 人工智能
音频与语音处理
摘要
在本文中,我们解决了真实世界录音中语音增强的挑战,这些录音通常包含各种形式的失真,例如背景噪声、混响和麦克风伪影。我们重新审视了生成对抗网络(GAN)在语音增强中的应用,并从理论上证明,GAN 自然倾向于寻找条件干净语音分布中的最大密度点,我们认为这对于语音增强任务至关重要。我们研究了用于感知损失的各种特征提取器,以促进对抗训练的稳定性,并开发了一种探测特征空间结构的方法。这促使我们将基于 WavLM 的感知损失集成到 MS-STFT 对抗训练流程中,为语音增强模型创建了一个有效且稳定的训练过程。由此产生的语音增强模型,我们称之为 FINALLY,建立在 HiFi++ 架构之上,并增加了 WavLM 编码器和新的训练流程。在多个数据集上的实证结果证实了我们的模型能够以 48 kHz 产生清晰、高质量的语音,在语音增强领域达到了最先进的性能。演示页面:https://samsunglabs.github.io/FINALLY-page
引用
@article{arxiv.2410.05920,
title = {FINALLY: fast and universal speech enhancement with studio-like quality},
author = {Nicholas Babaev and Kirill Tamogashev and Azat Saginbaev and Ivan Shchekotov and Hanbin Bae and Hosang Sung and WonJun Lee and Hoon-Young Cho and Pavel Andreev},
journal= {arXiv preprint arXiv:2410.05920},
year = {2024}
}
备注
Accepted to NeurIPS 2024