中文

预训练 Wav2Vec 2.0 在域偏移 ASR 上的表现如何?基于空中交通管制通信的广泛基准测试

音频与语音处理 2022-10-18 v2 计算与语言 机器学习

摘要

近期关于自监督预训练的工作聚焦于利用大规模无标注语音数据构建鲁棒的端到端(E2E)声学模型(AM),随后可在下游任务(如自动语音识别,ASR)上微调。然而,鲜有研究考察当预训练与微调阶段数据特性存在显著差异(称为域偏移)时对性能的影响。我们针对该场景,通过分析 Wav2Vec 2.0 与 XLS-R 模型在完全未见域——空中交通管制(ATC)通信——下游 ASR 上的鲁棒性。我们在多个信噪比介于 5 至 20 dB 的开源且具有挑战性的 ATC 数据库上对上述两模型进行基准测试。仅用较小比例标注数据微调 E2E 声学模型,相较基于混合的 ASR 基线取得了 20% 至 40% 的相对词错率(WER)降低。我们分析了低资源场景下的 WER 以及某一 ATC 数据集所携带的性别偏差。

关键词

引用

@article{arxiv.2203.16822,
  title  = {How Does Pre-trained Wav2Vec 2.0 Perform on Domain Shifted ASR? An Extensive Benchmark on Air Traffic Control Communications},
  author = {Juan Zuluaga-Gomez and Amrutha Prasad and Iuliia Nigmatulina and Saeed Sarfjoo and Petr Motlicek and Matthias Kleinert and Hartmut Helmke and Oliver Ohneiser and Qingran Zhan},
  journal= {arXiv preprint arXiv:2203.16822},
  year   = {2022}
}

备注

To be published in the 2022 IEEE Spoken Language Technology Workshop (SLT) (SLT 2022)