中文

Lead2Gold:充分挖掘含噪转录文本在语音识别中的潜力

计算与语言 2019-10-17 v1 人工智能 机器学习 音频与语音处理

摘要

用于训练自动语音识别(ASR)系统的转录文本可能包含错误。通常,要么通过质量控制阶段丢弃错误过多的转录文本,要么直接使用含噪转录文本。我们提出Lead2Gold,这是一种训练ASR系统的方法,能够充分挖掘含噪转录文本的潜力。基于转录错误的噪声模型,Lead2Gold通过考虑该噪声模型的束搜索来寻找训练数据的更优转录文本。该束搜索是可微分的,且无需强制对齐步骤,因此整个系统可端到端训练。Lead2Gold可视为一种新的损失函数,可用于任何序列到序列深度神经网络之上。我们在由不同噪声级别的字母损坏生成的含噪转录文本上进行了概念验证实验。结果表明,与不考虑(人为引入的)转录噪声的竞争基线相比,Lead2Gold获得了更好的ASR准确率。

关键词

引用

@article{arxiv.1910.07323,
  title  = {Lead2Gold: Towards exploiting the full potential of noisy transcriptions for speech recognition},
  author = {Adrien Dufraux and Emmanuel Vincent and Awni Hannun and Armelle Brun and Matthijs Douze},
  journal= {arXiv preprint arXiv:1910.07323},
  year   = {2019}
}

备注

8 pages, 4 tables, Accepted for publication in ASRU 2019