中文

判别性语音识别重打分模型的缩放定律

音频与语音处理 2023-06-29 v1

摘要

近期研究发现,对于广泛的问题,模型性能与训练数据及模型规模之间存在平滑的幂律关系,即缩放定律。这些缩放定律使人能够选择近乎最优的数据与模型规模。我们研究这种缩放特性是否也适用于二遍重打分——它是语音识别系统的一个重要组成部分。我们聚焦于 RescoreBERT 作为重打分模型,其使用基于 Transformer 的预训练架构,并通过 ASR 判别损失进行微调。使用这样的重打分模型,我们展示了随着训练数据和模型规模增大,词错误率(WER)在超过两个数量级上遵循缩放定律。此外,发现预训练模型比同规模的随机初始化模型需要更少的数据,代表了从预训练阶段迁移的有效数据。发现该迁移的有效数据也随数据和模型规模遵循缩放定律。

关键词

引用

@article{arxiv.2306.15815,
  title  = {Scaling Laws for Discriminative Speech Recognition Rescoring Models},
  author = {Yile Gu and Prashanth Gurunath Shivakumar and Jari Kolehmainen and Ankur Gandhe and Ariya Rastrow and Ivan Bulyko},
  journal= {arXiv preprint arXiv:2306.15815},
  year   = {2023}
}