中文

面向时间同步语音识别模型的正确标签上下文

声音 2025-01-10 v2 音频与语音处理

摘要

当前的时间同步序列到序列自动语音识别 (ASR) 模型是通过对所有对齐方式求和的序列级交叉熵进行训练。由于其判别性表述,纳入正确标签上下文以导致训练准则的梯度会导致归一化问题,且不够数学上严谨。经典的混合神经网络隐藏马尔可夫模型 (NN-HMM) 由于其内在的生成性表述,能够对正确的标签上下文进行条件化。然而,由于 HMM 的状态绑定,正确的标签上下文的身份从未被显式建模。在本工作中,我们提出了一种包含辅助左侧和右侧标签上下文的因子化损失函数,其对所有对齐方式求和。我们表明,正确标签上下文的纳入在训练数据资源有限时尤其有益。此外,我们还表明,仅依赖于全求和准则即可构建一个因子化混合 HMM 系统。在 Switchboard 300h 和 LibriSpeech 960h 上进行了实验。

关键词

引用

@article{arxiv.2501.04521,
  title  = {Right Label Context in End-to-End Training of Time-Synchronous ASR Models},
  author = {Tina Raissi and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:2501.04521},
  year   = {2025}
}

备注

Accepted for presentation at ICASSP 2025