自监督语音模型用于自动语音识别的高效适配器迁移
计算与语言
2022-02-08 v1 声音
音频与语音处理
摘要
自监督学习(SSL)是一种强大的工具,可从无标注数据中学习底层表示。基于Transformer的模型如wav2vec 2.0和HuBERT在语音领域处于领先地位。通常这些模型会在少量标注数据上针对下游任务(如自动语音识别(ASR))进行微调。这涉及为每个任务重新训练模型的大部分参数。适配器是小型轻量模块,常用于自然语言处理(NLP)中将预训练模型适配到新任务。在本文中,我们提出将适配器应用于wav2vec 2.0,以减少下游ASR任务所需的参数量,并提升模型对多任务或多语言的可扩展性。使用适配器,我们可以在执行ASR时每个任务训练少于10%的参数(相比全微调),而性能下降很小。消融实验表明,仅将适配器应用于预训练网络的顶部几层即可获得与全迁移相似的性能,支持了更高预训练层编码更多音素信息的理论,并进一步优化了效率。
引用
@article{arxiv.2202.03218,
title = {Efficient Adapter Transfer of Self-Supervised Speech Models for Automatic Speech Recognition},
author = {Bethan Thomas and Samuel Kessler and Salah Karout},
journal= {arXiv preprint arXiv:2202.03218},
year = {2022}
}
备注
5 Pages, 4 figures. Accepted to ICASSP 2022