中文

一种联合噪声解耦与对抗训练的鲁棒说话人验证框架

声音 2024-09-27 v2 音频与语音处理

摘要

自动说话人验证(ASV)在噪声条件下性能会下降。为了解决这个问题,我们提出了一种新颖的对抗学习框架,该框架结合了噪声解耦以建立与噪声无关的说话人不变嵌入空间。具体来说,解耦模块包括两个编码器,分别用于分离与说话人相关和无关的信息。重建模块作为正则化项来约束噪声。还使用了一种特征鲁棒损失来监督说话人编码器学习与噪声无关的说话人嵌入,同时不丢失说话人信息。此外,引入对抗训练以阻止说话人编码器编码声学条件信息,从而实现说话人不变的嵌入空间。在VoxCeleb1上的实验表明,所提出的方法在干净和噪声条件下均提高了说话人验证系统的性能。

关键词

引用

@article{arxiv.2408.11562,
  title  = {A Joint Noise Disentanglement and Adversarial Training Framework for Robust Speaker Verification},
  author = {Xujiang Xing and Mingxing Xu and Thomas Fang Zheng},
  journal= {arXiv preprint arXiv:2408.11562},
  year   = {2024}
}

备注

5 pages, accepted by Interspeech2024