中文

利用神经架构搜索提升端到端语音识别

音频与语音处理 2023-05-23 v2 信息检索 机器学习 声音

摘要

深度神经网络(DNNs)已被证明在自动语音识别(ASR)中优于许多传统机器学习算法。在本文中,我们展示了通过有效的神经架构优化,可以以极低的计算成本大幅提深语音模型的准确率。使用流行的LibriSpeech和TIMIT基准进行的音素识别测试证明了这一事实,其显示出能够在几小时(不到一天)内发现并训练新颖候选模型,速度比基于注意力的seq2seq模型快许多倍。我们的方法在LibriSpeech语料库上实现了7%词错误率(WER)的测试错误,在TIMIT语料库上实现了13%音素错误率(PER),与最先进结果相当。

关键词

引用

@article{arxiv.1912.05946,
  title  = {Leveraging End-to-End Speech Recognition with Neural Architecture Search},
  author = {Ahmed Baruwa and Mojeed Abisiga and Ibrahim Gbadegesin and Afeez Fakunle},
  journal= {arXiv preprint arXiv:1912.05946},
  year   = {2023}
}

备注

A large part of the document needs to be reviewed to meet current standards in the Automatic Speech Recognition