零样语音识别的简单方法规模化
计算与语言
2024-07-26 v1
摘要
尽管自动语音识别领域在提高语言覆盖范围方面取得了快速进展,但仍远未覆盖所有已知书写脚本的语言。最近的工作表明,仅需少量文本数据即可实现零样方法,效果令人鼓舞,但准确率严重依赖于所用音素模型的质量,而该音素模型对于未见语言往往较弱。本文提出 MMS 零样方法,采用罗马化方案及声学模型训练,数据覆盖 1,078 种不同语言,相当于其前任工作的三个数量级。MMS 零样方法将 100 种未见语言的平均字符错误率降低了约 46%。此外,本方法的错误率仅为领域内监督基线的 2.5 倍,而且对评估语言完全不使用标记数据。
引用
@article{arxiv.2407.17852,
title = {Scaling A Simple Approach to Zero-Shot Speech Recognition},
author = {Jinming Zhao and Vineel Pratap and Michael Auli},
journal= {arXiv preprint arXiv:2407.17852},
year = {2024}
}
备注
9 pages