中文

O-1:基于预言假设与 1-best 假设的自训练方法

机器学习 2023-08-16 v1 计算与语言 声音 音频与语音处理

摘要

我们提出 O-1,一种用于减少训练偏差并统一语音识别训练与评估指标的新自训练目标。O-1 是期望最小贝叶斯风险(EMBR)的一种更快变体,其提升预言假设(oracle hypothesis)并能够同时利用有监督与无监督数据。我们在公开的 SpeechStew 数据集和一个大规模内部数据集上展示了我们方法在识别方面的有效性。在 SpeechStew 上,相较于 EMBR 相对弥合 43% 的实际与预言性能差距,O-1 目标相对缩小了该差距的 80%。O-1 在 SpeechStew 所包含的各数据集上取得相对 EMBR 13% 至 25% 的提升,并在内部数据集上相对 EMBR 训练将相对于预言词错率(WER)的差距缩小了 12%。总体而言,O-1 相对 EMBR 在 WER 上取得 9% 的相对改进,从而证明了所提目标在大规模数据集上的可扩展性。

关键词

引用

@article{arxiv.2308.07486,
  title  = {O-1: Self-training with Oracle and 1-best Hypothesis},
  author = {Murali Karthick Baskar and Andrew Rosenberg and Bhuvana Ramabhadran and Kartik Audhkhasi},
  journal= {arXiv preprint arXiv:2308.07486},
  year   = {2023}
}