中文

说话人增强技术在说话人识别中的全面调查

声音 2024-06-12 v1 音频与语音处理

摘要

数据增强(DA)在深度说话人识别取得成功中发挥了关键作用。当前 DA 技术主要聚焦于保持说话人特征的增强,即不改变说话人的特征,也不生成新说话人。近期研究关注说话人增强的潜力,即生成新说话人以丰富训练数据集。本研究深入探讨了两种说话人增强方法:语速扰动(SP)和声道长度扰动(VTLP)。尽管两者在实际应用中广泛使用,但缺乏对其有效性的全面考察。我们的研究基于两个公开数据集 VoxCeleb 和 CN-Celeb,发现 SP 和 VTLP 均能有效生成新说话人,显著提升说话人识别性能。此外,它们在对扰动因子敏感性和数据复杂度方面表现出差异,暗示了其融合的潜在优势。我们的研究强调了说话人增强的巨大潜力,强调深入探索和分析的重要性。

关键词

引用

@article{arxiv.2406.07421,
  title  = {A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition},
  author = {Zhenyu Zhou and Shibiao Xu and Shi Yin and Lantian Li and Dong Wang},
  journal= {arXiv preprint arXiv:2406.07421},
  year   = {2024}
}

备注

to be published in INTERSPEECH 2024