BEST-RQ语音处理开放实现与研究
计算与语言
2024-09-05 v2 机器学习
摘要
自监督学习 (SSL) 在 various speech tasks 中已证明有用。然而,这些方法在数据、内存和计算资源方面都非常具有挑战性。基于BERT的语音预训练带随机投影量化器 (BEST-RQ) 是一种在自动语音识别 (ASR) 中表现优异且比其他SSL方法(如wav2vec 2.0)更简单的SSL方法。尽管BEST-RQ表现卓越,但原始论文中缺乏细节,例如在预训练中使用的GPU/TPU小时数,以及没有官方易于使用的开源实现。此外,BEST-RQ仅在ASR和语音翻译之外的下游任务上进行了评估。本文描述了随机投影量化器的重新实现,并与wav2vec 2.0在四个下游任务上的 preliminary study 进行比较。我们讨论了实现细节和差异。我们展示,随机投影量化器在保持类似于wav2vec 2.0的下游性能的同时,可将训练时间缩短一半以上。
引用
@article{arxiv.2405.04296,
title = {Open Implementation and Study of BEST-RQ for Speech Processing},
author = {Ryan Whetten and Titouan Parcollet and Marco Dinarelli and Yannick Estève},
journal= {arXiv preprint arXiv:2405.04296},
year = {2024}
}
备注
Accepted in IEEE ICASSP 2024 workshop on Self-supervision in Audio, Speech and Beyond (SASB 2024)