适配与调整:克服多语言语音识别的长尾问题
计算与语言
2020-12-04 v1 人工智能
机器学习
摘要
现实世界中多语言语音识别的一个关键挑战是长尾分布问题,即英语等资源丰富语言拥有大量训练数据,而长尾上的低资源语言训练数据量各异且有限。为克服长尾问题,本文提出 Adapt-and-Adjust (A2),一种基于 transformer 的端到端多语言语音识别多任务学习框架。A2 框架通过三种技术克服长尾问题:(1) 利用预训练多语言语言模型 (mBERT) 提升低资源语言性能;(2) 提出由语言特定与语言无关自适应组成的双适配器,仅增加极少参数;(3) 通过在训练时损失中引入类别先验或在推理时调整 softmax 输出的 logits 来克服类别不平衡。在 CommonVoice 语料库上的大量实验表明,A2 显著优于传统方法。
引用
@article{arxiv.2012.01687,
title = {Adapt-and-Adjust: Overcoming the Long-Tail Problem of Multilingual Speech Recognition},
author = {Genta Indra Winata and Guangsen Wang and Caiming Xiong and Steven Hoi},
journal= {arXiv preprint arXiv:2012.01687},
year = {2020}
}