中文

SSVD:用于ASR域迁移的参数高效微调的结构化奇异值分解

计算与语言 2025-09-04 v1 音频与语音处理

摘要

参数高效微调(PEFT)已成为适配大型基础模型的可扩展解决方案。虽然低秩适应(LoRA)在语音应用中广泛使用,但其最新变体(如 VeRA、DoRA、PiSSA 和 SVFT)主要为语言和视觉任务开发,仅在语音领域进行了有限验证。本文首次在 ESPnet 中实现并系统评估了这些 PEFT 方法。我们进一步引入结构化奇异值分解引导(SSVD)微调,该方法在保持输出关联向量不变以保留语义映射的同时, selectively 旋转输入关联的右奇异向量。该设计使得在最小可训练参数和提高效率的同时实现稳健的域适应。我们在跨模型规模(0.1B至2B)的域迁移语音识别任务上评估了所有方法,包括儿童语音和方言变体。所有实现均已发布于 ESPnet,以支持可重复性和后续工作。

关键词

引用

@article{arxiv.2509.02830,
  title  = {SSVD: Structured SVD for Parameter-Efficient Fine-Tuning and Benchmarking under Domain Shift in ASR},
  author = {Pu Wang and Shinji Watanabe and Hugo Van hamme},
  journal= {arXiv preprint arXiv:2509.02830},
  year   = {2025}
}

备注

Accepted by IEEE ASRU 2025