面向 OpenSTT——俄罗斯开放语音转文本数据集的端到端 ASR 探索
音频与语音处理
2020-10-08 v2 计算与语言
机器学习
声音
摘要
本文展示了对最大规模开源俄语数据集——OpenSTT 的端到端自动语音识别系统(ASR)的探索。我们评估了不同的现有端到端方法,如联合 CTC/Attention、RNN-Transducer 与 Transformer。它们全部与基于 LF-MMI TDNN-F 声学模型的强混合 ASR 系统进行比较。对于三个可用的验证集(电话通话、YouTube 与书籍),我们最佳的端到端模型分别取得了 34.8%、19.1% 与 18.1% 的词错误率(WER)。在相同条件下,混合 ASR 系统表现出 33.5%、20.9% 与 18.6% 的 WER。
引用
@article{arxiv.2006.08274,
title = {Exploration of End-to-End ASR for OpenSTT -- Russian Open Speech-to-Text Dataset},
author = {Andrei Andrusenko and Aleksandr Laptev and Ivan Medennikov},
journal= {arXiv preprint arXiv:2006.08274},
year = {2020}
}
备注
Accepted by SPECOM 2020