论注册语音增强对目标说话人提取的有效性
声音
2024-09-17 v1 音频与语音处理
摘要
深度学习技术显著提升了目标说话人提取任务的性能。为了在训练数据不足时增强这些算法的泛化性和鲁棒性,数据增强是一种常用的技术。与通常应用于语音混合的典型数据增强不同,本工作深入研究了增强注册语音空间的有效性。我们发现,对于预训练和联合优化的说话人编码器,直接增强注册语音都能带来一致的性能提升。除了噪声和混响添加等传统方法外,我们提出了一种新颖的增强方法,称为自估计语音增强。在Libri2Mix测试集上的实验结果表明,我们提出的方法可以实现高达2.5 dB的提升。
引用
@article{arxiv.2409.09589,
title = {On the effectiveness of enrollment speech augmentation for Target Speaker Extraction},
author = {Junjie Li and Ke Zhang and Shuai Wang and Haizhou Li and Man-Wai Mak and Kong Aik Lee},
journal= {arXiv preprint arXiv:2409.09589},
year = {2024}
}
备注
Accepted by SLT2024