中文

基于时域GAN的联合域自适应与语音带宽扩展用于说话人验证

音频与语音处理 2022-04-01 v1 声音

摘要

针对特定声学域和采样频率开发的语音系统不易迁移到其他配置。通常的做法是独立学习域自适应和带宽扩展模型。与此相反,我们提出同时学习这两个任务。具体而言,我们学习将窄带会话电话语音映射为宽带麦克风语音。我们开发了利用成对与非成对数据的并行与非并行学习方案。首先,我们讨论了针对我们任务多个生成模型的联合与分离训练。随后,我们提出一种两阶段学习方案,在带宽扩展训练中使用预训练的域自适应系统进行预处理。我们在说话人验证下游任务上评估了我们的方案。我们采用了NIST SRE21的JHU-MIT实验设置,其包含SRE16、SRE-CTS Superset和SRE21。我们的结果首次证明同时学习两个任务优于仅学习其中一个。在SRE16上,我们的最佳系统相对于直接学习基线在等错误率上取得了22%的相对提升,相对于一个强带宽扩展系统取得了8%的相对提升。

关键词

引用

@article{arxiv.2203.16614,
  title  = {Joint domain adaptation and speech bandwidth extension using time-domain GANs for speaker verification},
  author = {Saurabh Kataria and Jesús Villalba and Laureano Moro-Velázquez and Najim Dehak},
  journal= {arXiv preprint arXiv:2203.16614},
  year   = {2022}
}

备注

submitted to Interspeech 2022