基于时域GAN的联合域自适应与语音带宽扩展用于说话人验证
音频与语音处理
2022-04-01 v1 声音
摘要
针对特定声学域和采样频率开发的语音系统不易迁移到其他配置。通常的做法是独立学习域自适应和带宽扩展模型。与此相反,我们提出同时学习这两个任务。具体而言,我们学习将窄带会话电话语音映射为宽带麦克风语音。我们开发了利用成对与非成对数据的并行与非并行学习方案。首先,我们讨论了针对我们任务多个生成模型的联合与分离训练。随后,我们提出一种两阶段学习方案,在带宽扩展训练中使用预训练的域自适应系统进行预处理。我们在说话人验证下游任务上评估了我们的方案。我们采用了NIST SRE21的JHU-MIT实验设置,其包含SRE16、SRE-CTS Superset和SRE21。我们的结果首次证明同时学习两个任务优于仅学习其中一个。在SRE16上,我们的最佳系统相对于直接学习基线在等错误率上取得了22%的相对提升,相对于一个强带宽扩展系统取得了8%的相对提升。
引用
@article{arxiv.2203.16614,
title = {Joint domain adaptation and speech bandwidth extension using time-domain GANs for speaker verification},
author = {Saurabh Kataria and Jesús Villalba and Laureano Moro-Velázquez and Najim Dehak},
journal= {arXiv preprint arXiv:2203.16614},
year = {2022}
}
备注
submitted to Interspeech 2022