面向自监督编码器-解码器语音模型的提示与适配器微调
音频与语音处理
2023-11-16 v3 计算与语言
信号处理
摘要
提示(prompting)与适配器微调(adapter tuning)已成为微调(FT)方法的高效替代方案。然而,现有关于语音提示的研究集中于分类任务,在更复杂的序列生成任务上表现不佳。此外,适配器微调主要应用于以编码器为中心的自监督模型。我们的实验表明,在自监督编码器-解码器模型 Wav2Seq 上进行提示超越了以往工作在序列生成任务上的表现。其在 ASR 的词错率上取得了 53% 的相对提升,在槽填充的 F1 分数上取得了 27% 的相对提升。此外,在低资源场景下提示可与 FT 方法相竞争。进而,我们展示了在 Wav2Seq 上提示与适配器微调在跨语言 ASR 中的可迁移性。在可训练参数受限时,提示与适配器微调在 7 种语言上一致优于常规 FT。值得注意的是,在低资源场景下,提示一致优于适配器微调。
引用
@article{arxiv.2310.02971,
title = {Prompting and Adapter Tuning for Self-supervised Encoder-Decoder Speech Model},
author = {Kai-Wei Chang and Ming-Hsin Chen and Yun-Ping Lin and Jing Neng Hsu and Paul Kuo-Ming Huang and Chien-yu Huang and Shang-Wen Li and Hung-yi Lee},
journal= {arXiv preprint arXiv:2310.02971},
year = {2023}
}
备注
Accepted to IEEE ASRU 2023