Master-ASR:基于模块化学习实现 ASR 的多语言可扩展性与低资源自适应
音频与语音处理
2023-06-29 v1 计算与语言
摘要
尽管自动语音识别(ASR)近期取得了令人印象深刻的性能,我们观察到两个阻碍其更广泛应用的主要挑战:(1)难以在模型中引入可扩展性,以有限的训练、推理和存储开销支持更多语言;(2)低资源自适应能力,能够在避免过拟合和灾难性遗忘问题的同时实现有效的低资源自适应。受近期发现的启发,我们假设可以通过跨语言广泛共享的模块来解决上述挑战。为此,我们提出了一个称为\METHODNS 的 ASR 框架,该框架首次凭借其“先模块化再组装”的策略,同时实现了强大的多语言可扩展性和低资源自适应能力。具体而言,\METHOD 学习一小部分可泛化的子模块,并针对不同语言自适应地组装它们,以减少多语言开销并实现低资源自适应的有效知识迁移。大量实验与可视化表明,\METHOD 能够有效发现语言相似性,并在多语言和低资源 ASR 性能上优于最先进的(SOTA)方法,例如,在多语言 ASR 下,我们的框架相比 SOTA 方案实现了低 0.132.41 的字符错误率(CER),且推理开销小 30%;在低资源微调上,与 SOTA 方案相比 CER 相当,但可训练参数几乎少 50 倍。
引用
@article{arxiv.2306.15686,
title = {Master-ASR: Achieving Multilingual Scalability and Low-Resource Adaptation in ASR with Modular Learning},
author = {Zhongzhi Yu and Yang Zhang and Kaizhi Qian and Yonggan Fu and Yingyan Lin},
journal= {arXiv preprint arXiv:2306.15686},
year = {2023}
}