中文

在 ML-SUPERB 2.0 上改进多语言语音模型:基于数据增强和 LID 感知 CTC 的微调

声音 2025-06-04 v2 计算与语言 音频与语音处理

摘要

使用自监督或监督预训练的语音基础模型(SFM)进行多语言语音处理,在语言识别(LID)和自动语音识别(ASR)等任务上取得了优异的性能。然而,这些模型在微调期间面临有限资源的困难。本文通过探索适配 SFM 的多种策略(包括冻结上游训练、部分微调和低秩适配),增强了 ML-SUPERB 2.0 上的多语言 LID 和 ASR。此外,我们采用数据增强来缓解少样本设置下的性能差距,并引入 LID 联结时间分类(CTC)损失进行正则化。我们的方法在 ML-SUPERB 2.0 上实现了 LID 准确率 14% 的相对提升和 ASR CER 30% 的相对降低,在 Interspeech 2025 ML-SUPERB 2.0 挑战赛中荣获第二名。

关键词

引用

@article{arxiv.2505.24200,
  title  = {Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC},
  author = {Qingzheng Wang and Jiancheng Sun and Yifan Peng and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2505.24200},
  year   = {2025}
}