利用辅助 CTC 目标改进大规模多语言 ASR
计算与语言
2023-02-28 v2 声音
音频与语音处理
摘要
多语言自动语音识别(ASR)模型已将语音技术的可用性扩展到多种语言。然而,面对这些模型必须处理的众多语言,理解其在不同语言上性能不平衡的一个关键在于考察模型是否真正知道它应当转写哪种语言。在本文中,我们介绍了通过使整个模型以语言身份(LID)为条件来提升 FLEURS(一个 102 语言开放 ASR 基准)上性能的工作。我们研究了受近期连接主义时序分类(CTC)研究启发的技术,以借助辅助任务的 LID 预测为条件帮助模型处理大量语言。我们的实验结果表明,相较于标准的基于 CTC/Attention 的混合模型,我们的技术更为有效。此外,我们使用具有 Conformer 架构的自监督模型所构建的先进系统在 FLEURS 上以相对 28.4% 的 CER 优于先前工作的结果。训练好的模型与可复现方案可在 https://github.com/espnet/espnet/tree/master/egs2/fleurs/asr1 获取。
引用
@article{arxiv.2302.12829,
title = {Improving Massively Multilingual ASR With Auxiliary CTC Objectives},
author = {William Chen and Brian Yan and Jiatong Shi and Yifan Peng and Soumi Maiti and Shinji Watanabe},
journal= {arXiv preprint arXiv:2302.12829},
year = {2023}
}
备注
5 pages, 1 figure, accepted at ICASSP 2023; fixed typo and URL in abstract