面向语音基础模型的高效领域自适应
计算与语言
2023-02-06 v1 机器学习
声音
音频与语音处理
摘要
基础模型(FMs)在大规模广泛数据上训练并可适配多种下游任务,已在研究界引起广泛关注。受益于不同模态、语言和应用领域等多样数据源,基础模型展现出强大的泛化与知识迁移能力。本文针对基于基础模型的语音识别系统,提出一种高效解决方案的开拓性研究。我们采用近期提出的自监督 BEST-RQ 进行预训练,并提出利用 JUST Hydra 联合微调源域与无监督目标域数据。随后使用少量有监督域内数据将基础模型编码器适配器和解码器微调至目标域。在大规模 YouTube 和 Voice Search 任务上,我们的方法被证明在数据和模型参数上均高效。仅使用 21.6M 有监督域内数据和 130.8M 微调参数,即可达到与使用额外 300M 有监督域内数据从头训练的 731.1M 模型相同的质量。
引用
@article{arxiv.2302.01496,
title = {Efficient Domain Adaptation for Speech Foundation Models},
author = {Bo Li and Dongseong Hwang and Zhouyuan Huo and Junwen Bai and Guru Prakash and Tara N. Sainath and Khe Chai Sim and Yu Zhang and Wei Han and Trevor Strohman and Francoise Beaufays},
journal= {arXiv preprint arXiv:2302.01496},
year = {2023}
}