中文

利用数据增强与 VTLN 降低荷兰语端到端语音识别系统中的偏差

计算与语言 2023-07-06 v1

摘要

语音技术对于标准说话人(即无言语障碍或浓重口音的成年母语者)已有极大改进。然而,非标准或多样化说话人群体相较标准说话人存在明显的性能差距,我们称之为偏差。本工作中,我们旨在降低针对荷兰语不同年龄段及非母语说话人的偏差。对于端到端(E2E)ASR 系统,我们采用最先进的速度扰动与频谱增强作为数据增强技术,并探索声道长度归一化(VTLN)以因解剖差异导致的频谱差异进行归一化。数据增强与 VTLN 的结合使各多样化说话人群体的平均 WER 与偏差分别降低 6.9% 与 3.9%。基于荷兰语训练的 VTLN 模型亦有效提升了普通话儿童语音的性能,从而展现出跨语言的泛化能力。

关键词

引用

@article{arxiv.2307.02009,
  title  = {Using Data Augmentations and VTLN to Reduce Bias in Dutch End-to-End Speech Recognition Systems},
  author = {Tanvina Patel and Odette Scharenborg},
  journal= {arXiv preprint arXiv:2307.02009},
  year   = {2023}
}

备注

5 Pages, 2 Figures, 5 Tables