通过弹性权重巩固减少自动语音识别中的地域差异
音频与语音处理
2024-02-09 v1 声音
摘要
我们提出了一种在不降低整体用户群体性能的前提下,减少地域间性能差异的方法,用于自动语音识别(ASR)。一种常见方法是使用 ASR 模型词错误率(WER)较高的地区数据对模型进行微调。然而,当 ASR 模型为适应这些高 WER 地区而提升性能时,其参数会偏离先前的最优值,从而可能导致其他地区性能变差。在我们提出的方法中,我们利用弹性权重巩固(EWC)正则化损失来识别参数空间中 ASR 权重可沿之变化以改善高错误率地区、同时在整体说话人种群上仍保持性能的方向。我们的结果表明,EWC 能将最高 WER 地区的词错误率(WER)相对降低 3.2%,同时将整体 WER 相对降低 1.3%。我们还评估了语言模型与声学模型在 ASR 公平性中的作用,并提出了一种基于地域识别 WER 差异的聚类算法。
引用
@article{arxiv.2207.07850,
title = {Reducing Geographic Disparities in Automatic Speech Recognition via Elastic Weight Consolidation},
author = {Viet Anh Trinh and Pegah Ghahremani and Brian King and Jasha Droppo and Andreas Stolcke and Roland Maas},
journal= {arXiv preprint arXiv:2207.07850},
year = {2024}
}
备注
Accepted for publication at Interspeech 2022