基于 CycleGAN 的非配对语音去混响
音频与语音处理
2022-03-30 v1 声音
摘要
通常,基于神经网络的语音去混响模型在配对数据上训练,配对数据由干语句及其对应的混响语句组成。该方法的主要局限在于,由于获取真实配对数据成本高昂,此类模型只能在数据被合成混响时,于大量数据与多样房间脉冲响应上训练。本文提出一种基于 CycleGAN 的方法,使去混响模型能够在非配对数据上训练。我们通过将所提非配对模型与具有相同架构、在同一数据集的配对版本上训练的配对模型进行比较,量化使用非配对数据的影响。根据客观评价指标,我们在两个不同数据集上显示非配对模型的性能与配对模型相当。此外,我们进行了两项主观评价,并表明两个模型在训练期间未见的 AMI 数据集上取得相当的主观质量。
引用
@article{arxiv.2203.15652,
title = {CycleGAN-Based Unpaired Speech Dereverberation},
author = {Hannah Muckenhirn and Aleksandr Safin and Hakan Erdogan and Felix de Chaumont Quitry and Marco Tagliasacchi and Scott Wisdom and John R. Hershey},
journal= {arXiv preprint arXiv:2203.15652},
year = {2022}
}
备注
Submitted to Interspeech 2022