中文

基于 GAN 建模的时域语音超分辨率用于电话说话人验证

音频与语音处理 2022-09-07 v1

摘要

自动说话人验证(ASV)技术已在虚拟助手中变得普遍。然而,当训练与测试域之间存在不匹配时,其性能会下降。混合带宽训练,即合并来自两个域的训练数据,是开发适用于窄带与宽带域的通用模型的首选方案。我们提出通过窄带信号的神经上采样(亦称带宽扩展)来补充该技术。我们的主要目标是发现并分析高性能的时域生成对抗网络(GAN)基模型,以改进我们下游最先进的 ASV 系统。我们选择 GAN 是因为它们(1)善于学习条件分布,(2)允许作为预处理器在下游任务(ASV)训练中以数据增强方式灵活插入使用。先前工作主要关注特征域带宽扩展且实验设置有限。我们通过以下方式解决这些局限:1)使用时域扩展模型,2)在三个真实测试集上报告结果,3)扩展训练数据,以及 4)设计新的测试时方案。我们比较了有监督(条件 GAN)与无监督 GAN(CycleGAN),并分别展示了等错误率平均相对改善 8.6% 与 7.7%。为进一步分析,我们研究了语谱图视觉质量、音频感知质量、t-SNE 嵌入及 ASV 分数分布的变化。我们表明,我们的带宽扩展导致了诸如电话(测试)嵌入向宽带(训练)信号偏移、感知质量与下游性能负相关,以及条件无关的分数校准等现象。

关键词

引用

@article{arxiv.2209.01702,
  title  = {Time-domain speech super-resolution with GAN based modeling for telephony speaker verification},
  author = {Saurabh Kataria and Jesús Villalba and Laureano Moro-Velázquez and Piotr Żelasko and Najim Dehak},
  journal= {arXiv preprint arXiv:2209.01702},
  year   = {2022}
}

备注

Submit to IEEE/ACM Transactions on Audio, Speech, and Language Processing