中文

零样语音识别的简单方法规模化

计算与语言 2024-07-26 v1

摘要

尽管自动语音识别领域在提高语言覆盖范围方面取得了快速进展,但仍远未覆盖所有已知书写脚本的语言。最近的工作表明,仅需少量文本数据即可实现零样方法,效果令人鼓舞,但准确率严重依赖于所用音素模型的质量,而该音素模型对于未见语言往往较弱。本文提出 MMS 零样方法,采用罗马化方案及声学模型训练,数据覆盖 1,078 种不同语言,相当于其前任工作的三个数量级。MMS 零样方法将 100 种未见语言的平均字符错误率降低了约 46%。此外,本方法的错误率仅为领域内监督基线的 2.5 倍,而且对评估语言完全不使用标记数据。

关键词

引用

@article{arxiv.2407.17852,
  title  = {Scaling A Simple Approach to Zero-Shot Speech Recognition},
  author = {Jinming Zhao and Vineel Pratap and Michael Auli},
  journal= {arXiv preprint arXiv:2407.17852},
  year   = {2024}
}

备注

9 pages