面向语音识别优化的自监督训练 BEST-RQ
声音
2025-01-28 v1
摘要
自监督学习已成功应用于各种语音相关任务,包括自动语音识别。基于 BERT 的随机投影量化器语音预训练(BERT-based Speech pre-Training with Random-projection Quantizer, BEST-RQ)在语音识别中取得了 state-of-the-art 的结果。在本工作中,我们进一步优化 BEST-RQ 方法,使用 Kullback-Leibler 散度作为额外的正则化损失,并对由低层特征聚类导出的每个聚类进行多码本扩展。在 LibriSpeech train-100 划分上的初步实验中,通过使用多个码本在 test-clean 上取得了 11.2% 的相对改进;结合交叉熵和 Kullback-Leibler 散度进一步将词错误率降低了 4.5%。在完整 LibriSpeech 预训练和微调上的所提优化在使用 6 个码本时,在 test-clean 上取得了高达 23.8%、在 test-other 上取得了 30.6% 的相对词错误率改进。此外,所提设置加快了预训练和微调的收敛速度,并进一步稳定了预训练过程。
引用
@article{arxiv.2501.16131,
title = {Optimized Self-supervised Training with BEST-RQ for Speech Recognition},
author = {Ilja Baumann and Dominik Wagner and Korbinian Riedhammer and Tobias Bocklet},
journal= {arXiv preprint arXiv:2501.16131},
year = {2025}
}
备注
ICASSP 2025