利用学习过程间知识迁移的多语言语音识别
计算与语言
2021-10-18 v1 音频与语音处理
摘要
多语言端到端(E2E)模型在扩展自动语音识别(ASR)领域的语言覆盖方面显示出巨大潜力。本文旨在通过两种方式提升多语言 ASR 性能:1)研究输入标识语言的独热向量的影响,2)将任务构建为结合自监督学习(SSL)的元学习目标。我们将每种语言与一个独特的任务流形相关联,并尝试通过在学习过程本身之间迁移知识(而非通过最终模型参数迁移)来提升性能。我们通过最小化与期望梯度路径长度相关的目标,在一个包含 6 种语言的数据集上针对域内 ASR 任务采用此策略。实验结果表明,最佳预训练策略使整体 WER 相对降低 3.55%。当使用语言 ID 时,LEAP 与 SSL 的结合使整体 WER 相对降低 3.51%。
引用
@article{arxiv.2110.07909,
title = {Multilingual Speech Recognition using Knowledge Transfer across Learning Processes},
author = {Rimita Lahiri and Kenichi Kumatani and Eric Sun and Yao Qian},
journal= {arXiv preprint arXiv:2110.07909},
year = {2021}
}
备注
5 pages