中文

论注册语音增强对目标说话人提取的有效性

声音 2024-09-17 v1 音频与语音处理

摘要

深度学习技术显著提升了目标说话人提取任务的性能。为了在训练数据不足时增强这些算法的泛化性和鲁棒性,数据增强是一种常用的技术。与通常应用于语音混合的典型数据增强不同,本工作深入研究了增强注册语音空间的有效性。我们发现,对于预训练和联合优化的说话人编码器,直接增强注册语音都能带来一致的性能提升。除了噪声和混响添加等传统方法外,我们提出了一种新颖的增强方法,称为自估计语音增强。在Libri2Mix测试集上的实验结果表明,我们提出的方法可以实现高达2.5 dB的提升。

关键词

引用

@article{arxiv.2409.09589,
  title  = {On the effectiveness of enrollment speech augmentation for Target Speaker Extraction},
  author = {Junjie Li and Ke Zhang and Shuai Wang and Haizhou Li and Man-Wai Mak and Kong Aik Lee},
  journal= {arXiv preprint arXiv:2409.09589},
  year   = {2024}
}

备注

Accepted by SLT2024