SPGISpeech:用于全格式化端到端语音识别的 5000 小时转写金融音频
计算与语言
2021-04-07 v2 音频与语音处理
摘要
在英语语音转文本(STT)机器学习任务中,声学模型 conventionally 在大小写不敏感的拉丁字符上训练,任何必要的正字法(如大写、标点和非标准词的去归一化)由独立的后处理模型补全。这增加了复杂性并限制了性能,因为许多格式化任务受益于声学信号中存在但转写中缺失的语义信息。在此我们提出一个新的 STT 任务:以全格式化文本作为目标标签的端到端神经转写。我们展示了在 5000 小时专业转写的财报电话会议语料上训练的基于 Conformer 的基线模型,取得了 1.7 的 CER。作为对 STT 研究界的贡献,我们在 https://datasets.kensho.com/datasets/scribe 免费发布该语料供非商业使用。
引用
@article{arxiv.2104.02014,
title = {SPGISpeech: 5,000 hours of transcribed financial audio for fully formatted end-to-end speech recognition},
author = {Patrick K. O'Neill and Vitaly Lavrukhin and Somshubra Majumdar and Vahid Noroozi and Yuekai Zhang and Oleksii Kuchaiev and Jagadeesh Balam and Yuliya Dovzhenko and Keenan Freyberg and Michael D. Shulman and Boris Ginsburg and Shinji Watanabe and Georg Kucsko},
journal= {arXiv preprint arXiv:2104.02014},
year = {2021}
}
备注
5 pages, 1 figure. Submitted to INTERSPEECH 2021