中文

面向太平洋土著语言的持续适应语音识别

音频与语音处理 2026-03-09 v1 计算与语言 声音

摘要

语音基础模型在面对严重数据稀缺的太平洋土著语言时难以实现适应。此外,完全微调风险会导致灾难性遗忘。为此,我们进行了一项针对真实世界太平洋数据集的实证研究,探讨数据量和语言特征如何影响适应成功。具体而言,我们评估了包括全参数微调和低秩适应(LoRA)等策略。此外,我们分析了一个用于顺序获取多个语言的持续学习框架。我们证明,对这些远距离语言的适应会导致严重的内部表征漂移。因此,这些模型面临严格的塑性与稳定性困境。虽然LoRA在初始适应方面表现良好,但在顺序学习期间仍会遭遇灾难性遗忘。最终,本研究凸显了针对欠代表型语言开发稳健适应策略的迫切需求。

关键词

引用

@article{arxiv.2603.06310,
  title  = {Continual Adaptation for Pacific Indigenous Speech Recognition},
  author = {Yang Xiao and Aso Mahmudi and Nick Thieberger and Eliathamby Ambikairajah and Eun-Jung Holden and Ting Dang},
  journal= {arXiv preprint arXiv:2603.06310},
  year   = {2026}
}

备注

Submitted to Interspeech