中文

ZO-ASR:无反向传播的语音基础模型零阶精调

多媒体 2025-12-02 v1 声音

摘要

为自动语音识别(ASR)微调预训练语音基础模型是常见做法,但受限于大量GPU内存需求。我们引入ZO-ASR,一种内存高效的零阶(ZO)方法,避免反向传播(BP)和激活内存,通过前向传递估计梯度。当与SGD优化器结合时,ZO-ASR-SGD仅使用推理内存即可微调ASR模型。我们的评估涵盖监督和非监督任务。在Whisper-Large-V3的监督域适应上,ZO-ASR通过多查询机制提高了鲁棒性,相对于零样本基线实现了最高18.9%的相对词错误率降低,超越了现有零阶方法。在Wav2Vec2-Base的非监督测试时适应上,ZO-ASR的表现略低于一阶优化器Adam。我们的BP-free方法为在计算资源受限或无法访问梯度的场景下微调ASR模型提供了可行方案。

关键词

引用

@article{arxiv.2512.01267,
  title  = {ZO-ASR: Zeroth-Order Fine-Tuning of Speech Foundation Models without Back-Propagation},
  author = {Yuezhang Peng and Yuxin Liu and Yao Li and Sheng Wang and Fei Wen and Xie Chen},
  journal= {arXiv preprint arXiv:2512.01267},
  year   = {2025}
}

备注

2025 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU)