高内容保真的通用基于评分的语音增强
音频与语音处理
2024-06-19 v1 声音
摘要
我们提出了UNIVERSE++,一种基于评分扩散和对抗训练的通用语音增强方法。具体而言,我们改进了现有的UNIVERSE模型,该模型将干净语音特征提取和扩散解耦。我们的贡献有三方面:首先,我们对网络结构进行了若干修改,提高了训练稳定性和最终性能;其次,我们引入了对抗损失以促进学习高质量语音特征;最后,我们提出了一种低秩适应方案,结合音素保真度损失以提高增强后语音的内容保真度。在实验中,我们在包含噪声、混响以及各种失真的大规模语音数据集上训练了通用增强模型。结果表明,UNIVERSE++在多个公开基准数据集上,对比传统和生成性基线,在广泛的定性和可理解性指标方面表现优异。
引用
@article{arxiv.2406.12194,
title = {Universal Score-based Speech Enhancement with High Content Preservation},
author = {Robin Scheibler and Yusuke Fujita and Yuma Shirahata and Tatsuya Komatsu},
journal= {arXiv preprint arXiv:2406.12194},
year = {2024}
}
备注
5 pages, 5 figures, accepted at Interspeech 2024