中文

面向自监督编码器-解码器语音模型的提示与适配器微调

音频与语音处理 2023-11-16 v3 计算与语言 信号处理

摘要

提示(prompting)与适配器微调(adapter tuning)已成为微调(FT)方法的高效替代方案。然而,现有关于语音提示的研究集中于分类任务,在更复杂的序列生成任务上表现不佳。此外,适配器微调主要应用于以编码器为中心的自监督模型。我们的实验表明,在自监督编码器-解码器模型 Wav2Seq 上进行提示超越了以往工作在序列生成任务上的表现。其在 ASR 的词错率上取得了 53% 的相对提升,在槽填充的 F1 分数上取得了 27% 的相对提升。此外,在低资源场景下提示可与 FT 方法相竞争。进而,我们展示了在 Wav2Seq 上提示与适配器微调在跨语言 ASR 中的可迁移性。在可训练参数受限时,提示与适配器微调在 7 种语言上一致优于常规 FT。值得注意的是,在低资源场景下,提示一致优于适配器微调。

关键词

引用

@article{arxiv.2310.02971,
  title  = {Prompting and Adapter Tuning for Self-supervised Encoder-Decoder Speech Model},
  author = {Kai-Wei Chang and Ming-Hsin Chen and Yun-Ping Lin and Jing Neng Hsu and Paul Kuo-Ming Huang and Chien-yu Huang and Shang-Wen Li and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2310.02971},
  year   = {2023}
}

备注

Accepted to IEEE ASRU 2023