SSVD-O:面向语音识别的结构化 SVD 参数高效微调
声音
2026-01-21 v1 计算与语言
机器学习
音频与语音处理
摘要
参数高效微调 (PEFT) 是一种将大型语音基础模型适应新领域的可扩展方法。虽然 LoRA 及其最先进的变体等方法降低了适应成本,但它们通常跨模型子空间均匀分配参数,这限制了它们在语音应用中的效率和可扩展性。基于我们先前的工作,本文介绍了 SSVD-Outer (SSVD-O),这是结构化 SVD 引导 (SSVD) 微调方法的扩展。SSVD-O 将输入声学特征空间相关的内部变换与输出语义特征空间相关的外部变换相结合,以实现可扩展且平衡的适应。我们首次对自动语音识别 (ASR) 的 PEFT 中跨模型子空间的参数预算分配进行了系统分析,并研究了在资源受限条件下学习与遗忘之间的权衡。在 ESPnet 框架内,针对领域偏移的 ASR 任务(包括儿童语音和区域口音),在 0.1B 到 2B 的模型规模上,将 SSVD-O 与 LoRA、DoRA、PiSSA 和 SSVD 进行了基准测试。实验结果表明,SSVD-O 持续缩小了与全微调的性能差距,同时改善了泛化并减轻了灾难性遗忘。
引用
@article{arxiv.2601.12600,
title = {SSVD-O: Parameter-Efficient Fine-Tuning with Structured SVD for Speech Recognition},
author = {Pu Wang and Shinji Watanabe and Hugo Van hamme},
journal= {arXiv preprint arXiv:2601.12600},
year = {2026}
}
备注
Accepted by IEEE ICASSP 2026