基于语音转换的数据增强在文本相关说话人验证中的探索
声音
2020-11-24 v1 音频与语音处理
摘要
本文中,我们致力于提升有限训练数据场景下文本相关说话人验证系统的性能。基于深度学习的文本相关说话人验证系统通常需要大规模文本相关训练数据集,这可能在人力与成本上十分昂贵,尤其对于定制的新唤醒词。近期研究中,已提出可生成可见与不可见说话人高质量合成语音的语音转换系统。受这些工作启发,我们采用两种不同语音转换方法以及非常简单的重采样方法来生成新的文本相关语音样本以用于数据增强。实验结果表明,在有限训练数据场景下,所提方法将等错误率性能从 6.51% 显著提升至 4.51%。
引用
@article{arxiv.2011.10710,
title = {Exploring Voice Conversion based Data Augmentation in Text-Dependent Speaker Verification},
author = {Xiaoyi Qin and Yaogen Yang and Lin Yang and Xuyang Wang and Junjie Wang and Ming Li},
journal= {arXiv preprint arXiv:2011.10710},
year = {2020}
}
备注
Submitted to ICASSP2021