中文

SMILE:面向低资源语言自动语音识别的语音元上下文学习

音频与语音处理 2025-06-17 v2 计算与语言 声音

摘要

自动语音识别(ASR)模型在高资源语言上表现出色,但由于训练数据有限和跨语言泛化能力不足,在应用于低资源语言时面临重大挑战。现有的适应策略,如浅融合、数据增强和直接微调,要么依赖外部资源,要么存在计算效率低下的问题,或者在测试时适应场景中失败。为了解决这些局限性,我们引入了语音元上下文学习(SMILE),这是一个将元学习与语音上下文学习(SICL)相结合的创新框架。SMILE 利用来自高资源语言的元训练,实现对低资源语言的鲁棒少样本泛化,而无需在目标领域上进行显式微调。在 ML-SUPERB 基准上的大量实验表明,SMILE 始终优于基线方法,在无需训练的少样本多语言 ASR 任务中显著降低了字符和词错误率。

关键词

引用

@article{arxiv.2409.10429,
  title  = {SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition},
  author = {Ming-Hao Hsu and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2409.10429},
  year   = {2025}
}