中文

探索数据增强以减轻针对非母语口音语音的偏见

音频与语音处理 2023-12-27 v1

摘要

自动语音识别 (ASR) 应服务于每一位说话者,而不仅仅是某种语言的多数“标准”说话者。为了构建包容性的 ASR,减轻对以“非标准”或“多样化”方式说话的说话者群体的偏见至关重要。我们的目标是减轻佛兰芒语 ASR 系统中针对非母语口音佛兰芒语的偏见。由于这是一个低资源问题,我们研究了最优的数据增强类型,即速度/音高扰动、基于跨语言语音转换的方法以及 SpecAugment,并将它们应用于母语佛兰芒语和非母语口音佛兰芒语,以减轻偏见。结果表明,将特定类型的数据增强同时应用于母语和非母语口音语音可改善非母语口音的 ASR 性能,而仅对非母语口音语音应用数据增强更有利于减少偏见。结合两者可在人机交互 (HMI) 以及朗读型语音中实现最大的偏见减少。

关键词

引用

@article{arxiv.2312.15499,
  title  = {Exploring data augmentation in bias mitigation against non-native-accented speech},
  author = {Yuanyuan Zhang and Aaricia Herygers and Tanvina Patel and Zhengjun Yue and Odette Scharenborg},
  journal= {arXiv preprint arXiv:2312.15499},
  year   = {2023}
}

备注

Accepted to ASRU 2023