面向自动语音识别任务的性别域自适应
音频与语音处理
2020-11-18 v2 声音
摘要
本文关注于针对特定性别说话人自适应目标对声学模型进行微调。我们在Librispeech-960上预训练了Transformer基线模型,并在性别特定的测试子集上进行了微调实验。总体而言,通过此方法微调技术我们未获得本质性的词错率(WER)降低。若编码器与解码器中的层不被冻结且从最后的检查点开始调优,我们在男性子集上实现了约低5%的词错率,在女性子集上低3%。此外,我们在完整的L2 Arctic口音语音数据集上自适应了基础模型,并分别对特定说话人及男女性别进行微调。与在整个L2 Arctic数据集上调优的模型相比,在性别子集上训练的模型准确率高出1-2%。最后,我们测试了预训练x-vector语音嵌入与常规编码器嵌入的拼接,但其准确率增益不显著。
引用
@article{arxiv.2010.04224,
title = {Gender domain adaptation for automatic speech recognition task},
author = {Sokolov Artem and Andrey V. Savchenko},
journal= {arXiv preprint arXiv:2010.04224},
year = {2020}
}
备注
Draft of paper for SAMI conference