中文

用于鲁棒说话人验证的对抗性数据增强

声音 2024-02-07 v1 机器学习 音频与语音处理

摘要

数据增强(DA)因其易于实现和显著有效性而在深度说话人模型中广泛流行。它通过模拟真实世界的声学变化来丰富训练数据,使深度神经网络能够学习与说话人相关的表示,同时忽略无关的声学变化,从而提高鲁棒性和泛化能力。然而,原始DA的一个潜在问题是增强残差,即由不同类型增强引起的不必要失真。为了解决这个问题,本文提出了一种称为对抗性数据增强(A-DA)的新方法,它将DA与对抗学习相结合。具体来说,它引入了一个额外的增强分类器来对数据增强中使用的各种增强类型进行分类。这种对抗学习使网络能够生成可以欺骗增强分类器的说话人嵌入,使得学到的说话人嵌入在面对增强变化时更加鲁棒。在VoxCeleb和CN-Celeb数据集上进行的实验表明,我们提出的A-DA在增强匹配和不匹配的测试条件下均优于标准DA,展示了其对声学变化的卓越鲁棒性和泛化能力。

关键词

引用

@article{arxiv.2402.02699,
  title  = {Adversarial Data Augmentation for Robust Speaker Verification},
  author = {Zhenyu Zhou and Junhui Chen and Namin Wang and Lantian Li and Dong Wang},
  journal= {arXiv preprint arXiv:2402.02699},
  year   = {2024}
}