SSVD:用于ASR域迁移的参数高效微调的结构化奇异值分解
计算与语言
2025-09-04 v1 音频与语音处理
摘要
参数高效微调(PEFT)已成为适配大型基础模型的可扩展解决方案。虽然低秩适应(LoRA)在语音应用中广泛使用,但其最新变体(如 VeRA、DoRA、PiSSA 和 SVFT)主要为语言和视觉任务开发,仅在语音领域进行了有限验证。本文首次在 ESPnet 中实现并系统评估了这些 PEFT 方法。我们进一步引入结构化奇异值分解引导(SSVD)微调,该方法在保持输出关联向量不变以保留语义映射的同时, selectively 旋转输入关联的右奇异向量。该设计使得在最小可训练参数和提高效率的同时实现稳健的域适应。我们在跨模型规模(0.1B至2B)的域迁移语音识别任务上评估了所有方法,包括儿童语音和方言变体。所有实现均已发布于 ESPnet,以支持可重复性和后续工作。
引用
@article{arxiv.2509.02830,
title = {SSVD: Structured SVD for Parameter-Efficient Fine-Tuning and Benchmarking under Domain Shift in ASR},
author = {Pu Wang and Shinji Watanabe and Hugo Van hamme},
journal= {arXiv preprint arXiv:2509.02830},
year = {2025}
}
备注
Accepted by IEEE ASRU 2025