中文

基于Transformer的语音识别中音质与音高特征

计算与语言 2021-12-22 v1 机器学习 声音 音频与语音处理

摘要

抖动(jitter)和微扰(shimmer)测量已被证明承载音质和韵律信息,可提升说话人识别、说话人日志或自动语音识别(ASR)等任务的性能。然而,此类特征很少用于基于神经网络的ASR中,后者通常依赖谱特征。在本工作中,我们研究了将音质和音高特征共同及分别融入基于Transformer的ASR模型的效果,直觉是注意力机制可能利用潜在的韵律特性。为此,我们为韵律特征和谱特征提出分离的卷积前端,表明该架构选择比将此类音高和音质特征简单拼接至梅尔谱滤波器组带来更好的结果。此外,我们在LibriSpeech基准上获得了高达5.6%的平均词错误率相对降低。这些发现激励了对韵律知识应用以增进基于Transformer的ASR鲁棒性的进一步研究。

关键词

引用

@article{arxiv.2112.11391,
  title  = {Voice Quality and Pitch Features in Transformer-Based Speech Recognition},
  author = {Guillermo Cámbara and Jordi Luque and Mireia Farrús},
  journal= {arXiv preprint arXiv:2112.11391},
  year   = {2021}
}

备注

5 pages, 3 figures, submitted to Speech Prosody 2022 conference