面向70种语言的大规模多语言ASR:分词、架构与泛化能力
计算与语言
2022-11-11 v1 声音
音频与语音处理
摘要
端到端多语言自动语音识别(ASR)因简化训练与部署流程以及从高资源语言向低资源语言的正向性能迁移等原因而愈发具有吸引力。然而,扩大语言数量、总时长与唯一词元数量并非易事。本文探索了针对70种语言的大规模多语言 ASR 模型。我们考察了两种架构:(1)共享嵌入与输出;(2)多嵌入与输出模型。在共享模型实验中,我们展示了跨语言分词策略的重要性。随后,我们使用最优分词策略训练多嵌入与输出模型以进一步提升结果。我们的多语言 ASR 相比单语模型实现了13.9%–15.6%的平均词错率(WER)相对提升。我们表明,我们的多语言 ASR 在未见数据集与领域上泛化良好,在 Multilingual Librispeech(MLS)上以零样本与微调分别取得9.5%与7.5%的 WER。
引用
@article{arxiv.2211.05756,
title = {Massively Multilingual ASR on 70 Languages: Tokenization, Architecture, and Generalization Capabilities},
author = {Andros Tjandra and Nayan Singhal and David Zhang and Ozlem Kalinli and Abdelrahman Mohamed and Duc Le and Michael L. Seltzer},
journal= {arXiv preprint arXiv:2211.05756},
year = {2022}
}
备注
Submitted to ICASSP 2023