中文

面向缺陷数据集上说话人识别的语音转换增强

音频与语音处理 2025-09-03 v2

摘要

现代说话人识别系统依赖充足且均衡的数据集进行分类训练。然而,在真实应用中,各种缺陷数据集十分常见,如部分标注、小规模和不均衡数据集。以往的研究通常从算法角度针对每种场景研究特定的解决方案。但这些问题的根本原因在于数据集的不完善。为了用统一的方案应对这些挑战,我们提出了语音转换增强(VCA)策略,从训练集中获取伪语音。此外,为了保证生成质量,我们设计了 VCA-NN(最近邻)策略,从表征空间中与目标语音相近的语音片段中挑选源语音。我们在三个创建的数据集上的实验结果表明,VCA-NN 有效缓解了这些数据集问题,为从数据层面处理说话人识别问题提供了新方向。

关键词

引用

@article{arxiv.2404.00863,
  title  = {Voice Conversion Augmentation for Speaker Recognition on Defective Datasets},
  author = {Ruijie Tao and Zhan Shi and Yidi Jiang and Tianchi Liu and Haizhou Li},
  journal= {arXiv preprint arXiv:2404.00863},
  year   = {2025}
}

备注

6 pages