中文

前端适配器:为语音识别适配基于语音的自监督学习前端输入

音频与语音处理 2023-02-21 v1 计算与语言 声音

摘要

近年来,自监督学习(SSL)在包括语音处理在内的多个领域蓬勃发展。基于语音的 SSL 模型在一系列语音相关任务中展现出优异的性能。然而,SSL 模型的训练计算成本高昂,通常的做法是在特定任务上微调已发布的 SSL 模型。在预训练和微调期间使用一致的前端输入至关重要。当最优前端与预训练所用前端不同时,这种一致性可能引入潜在问题。本文提出一种简单但有效的前端适配器来解决此前端差异。通过最小化不同前端输出之间的距离,滤波器组特征(Fbank)可以与使用波形预训练的 SSL 模型兼容。实验结果证明了我们提出的前端适配器在多个流行的 SSL 模型上用于语音识别任务的有效性。

关键词

引用

@article{arxiv.2302.09331,
  title  = {Front-End Adapter: Adapting Front-End Input of Speech based Self-Supervised Learning for Speech Recognition},
  author = {Xie Chen and Ziyang Ma and Changli Tang and Yujin Wang and Zhisheng Zheng},
  journal= {arXiv preprint arXiv:2302.09331},
  year   = {2023}
}