利用数据增强与 VTLN 降低荷兰语端到端语音识别系统中的偏差
计算与语言
2023-07-06 v1
摘要
语音技术对于标准说话人(即无言语障碍或浓重口音的成年母语者)已有极大改进。然而,非标准或多样化说话人群体相较标准说话人存在明显的性能差距,我们称之为偏差。本工作中,我们旨在降低针对荷兰语不同年龄段及非母语说话人的偏差。对于端到端(E2E)ASR 系统,我们采用最先进的速度扰动与频谱增强作为数据增强技术,并探索声道长度归一化(VTLN)以因解剖差异导致的频谱差异进行归一化。数据增强与 VTLN 的结合使各多样化说话人群体的平均 WER 与偏差分别降低 6.9% 与 3.9%。基于荷兰语训练的 VTLN 模型亦有效提升了普通话儿童语音的性能,从而展现出跨语言的泛化能力。
引用
@article{arxiv.2307.02009,
title = {Using Data Augmentations and VTLN to Reduce Bias in Dutch End-to-End Speech Recognition Systems},
author = {Tanvina Patel and Odette Scharenborg},
journal= {arXiv preprint arXiv:2307.02009},
year = {2023}
}
备注
5 Pages, 2 Figures, 5 Tables