中文

编码器深度在削减 Whisper 和 LoRA 微调中的作用:面向 SLAM-ASR

计算与语言 2026-03-31 v1 声音

摘要

自动语音识别 (ASR) 近年来取得了快速进展,这得益于大规模预训练模型和面向端到端的架构,如 SLAM-ASR。SLAM-ASR 系统的关键组件是 Whisper 语音编码器,它提供稳健的声学表征。虽然已探索 Whisper 编码器-解码器架构的完整模型削减,但其在 SLAM-ASR 设置中的影响仍未深入调查。在本工作中,我们分析了在 SLAM-ASR 中用作声学主干的 Whisper 编码器的层削减效果。我们进一步检验了 LoRA 基于微调在多大程度上可以恢复因削减导致的性能下降。实验在三个 Whisper 变体(Small、Medium、Large-v2)、三个代表不同资源水平的语言(丹麦语、荷兰语、英语)以及 200 多次训练运行中进行,表明削减两个编码器层仅导致 2-4% 的 WER 下降,而且将此削减与 LoRA 适配结合使用时总能超过未削减的基线,同时将总参数减少 7-14%。此外,我们的错误分析揭示,LoRA 主要通过语言模型的语言先验进行补偿,使丹麦语和英语的总词错误减少 11-21%,其中替换和删除错误减少最大。然而,对于低资源语言的丹麦语,减少较小(4-7%),且 LoRA 引入增加的插入错误,这表明补偿效果取决于 LLM 的预先语言熟练程度以及可用训练数据的量。

关键词

引用

@article{arxiv.2603.27981,
  title  = {On the Role of Encoder Depth: Pruning Whisper and LoRA Fine-Tuning in SLAM-ASR},
  author = {Ganesh Pavan Kartikeya Bharadwaj Kolluri and Michael Kampouridis and Ravi Shekhar},
  journal= {arXiv preprint arXiv:2603.27981},
  year   = {2026}
}

备注

Accepted at SPEAKABLE Workshop, LREC 2026