中文

声源特征在歌唱语音识别中的使用

音频与语音处理 2021-02-24 v2 人工智能 信号处理

摘要

在本文中,我们探讨声源特征(音高、微颤、抖动等)能否提升自动歌唱语音识别的性能,并指出先前基于口语语音研究得出的结论在歌唱语音领域可能并不成立。我们首先使用并行歌唱/说话语料库(NUS-48E)来说明歌唱与说话发声特征(包括音高范围、音节时长、颤音、抖动和微颤)的差异。随后利用该分析指导在歌唱语音 DSing 语料库上的语音识别实验,采用最先进的声学模型并将常规特征与各类声源参数相增强。实验使用三个标准(递增规模)训练集:DSing1(15.1 小时)、DSing3(44.7 小时)和 DSing30(149.1 小时)。在使用 DSing1 训练时,音高结合发声程度使 WER(词错率)从 38.1% 显著降至 36.7%,但在使用规模更大且更多样的 DSing3 和 DSing30 集时观察到的 WER 较小降幅未具统计显著性。发声质量特征未能改善识别性能,尽管分析表明它们确实有助于提升浊音/清音音素对的区分度。

关键词

引用

@article{arxiv.2102.10376,
  title  = {The Use of Voice Source Features for Sung Speech Recognition},
  author = {Gerardo Roa Dabike and Jon Barker},
  journal= {arXiv preprint arXiv:2102.10376},
  year   = {2021}
}

备注

Accepted to ICASSP 2021