中文

BEST-RQ语音处理开放实现与研究

计算与语言 2024-09-05 v2 机器学习

摘要

自监督学习 (SSL) 在 various speech tasks 中已证明有用。然而,这些方法在数据、内存和计算资源方面都非常具有挑战性。基于BERT的语音预训练带随机投影量化器 (BEST-RQ) 是一种在自动语音识别 (ASR) 中表现优异且比其他SSL方法(如wav2vec 2.0)更简单的SSL方法。尽管BEST-RQ表现卓越,但原始论文中缺乏细节,例如在预训练中使用的GPU/TPU小时数,以及没有官方易于使用的开源实现。此外,BEST-RQ仅在ASR和语音翻译之外的下游任务上进行了评估。本文描述了随机投影量化器的重新实现,并与wav2vec 2.0在四个下游任务上的 preliminary study 进行比较。我们讨论了实现细节和差异。我们展示,随机投影量化器在保持类似于wav2vec 2.0的下游性能的同时,可将训练时间缩短一半以上。

关键词

引用

@article{arxiv.2405.04296,
  title  = {Open Implementation and Study of BEST-RQ for Speech Processing},
  author = {Ryan Whetten and Titouan Parcollet and Marco Dinarelli and Yannick Estève},
  journal= {arXiv preprint arXiv:2405.04296},
  year   = {2024}
}

备注

Accepted in IEEE ICASSP 2024 workshop on Self-supervision in Audio, Speech and Beyond (SASB 2024)