面向印度语言 ASR 的基于正则化的持续学习方法研究
机器学习
2025-08-11 v1
摘要
印度语言的多样性对开发包容性自动语音识别(ASR)系统构成了重大挑战。传统多语言模型需要同时访问所有语言数据,但由于数据的顺序到达和隐私限制而不切实际。持续学习(CL)通过使模型能够按顺序学习新语言而不会灾难性地遗忘先前学到的知识,提供了解决方案。本文使用 IndicSUPERB 基准的一个子集,研究了印度语言的持续学习 ASR。我们采用基于 Conformer 的混合 RNN-T/CTC 模型,首先在印地语上预训练,然后增量训练八种额外的印度语言,总共九种语言。我们评估了三种突出的基于正则化和蒸馏的持续学习策略:弹性权重巩固(EWC)、记忆感知突触(MAS)和不遗忘学习(LwF),因其适用于无回放、注重隐私的场景而入选。使用干净和噪声数据上 RNN-T 和 CTC 路径的词错误率(WER)以及通过后向迁移的知识保留来评估性能。我们还探讨了改变每个任务的训练轮数(1、2、5 和 10)的影响。与朴素微调相比,结果表明持续学习在减轻遗忘方面的有效性,使其成为在现实约束下为多样化印度语言实现可扩展 ASR 的有前景方法。代码可在 https://github.com/FrozenWolf-Cyber/Indic-CL-ASR 获取。
引用
@article{arxiv.2508.06280,
title = {A Study on Regularization-Based Continual Learning Methods for Indic ASR},
author = {Gokul Adethya T and S. Jaya Nirmala},
journal= {arXiv preprint arXiv:2508.06280},
year = {2025}
}