中文

面向近乎零资源语言的自动语音识别与主题识别

计算与语言 2018-06-20 v2

摘要

自动语音识别(ASR)系统常常需要为极低资源语言开发,以服务于音频内容分类与检索等终端应用。当某一语言中没有任何转写语音可用于训练 ASR 系统时,通用音素识别自然成为一个可考虑的方案;然而,利用极少量(以分钟而非小时计)的转写语音来适配通用音素模型同样需要研究,尤其是采用最先进的基于 DNN 的声学模型时。DARPA LORELEI 计划为这类极低资源 ASR 研究提供了框架,并为在人道主义援助、灾害救援场景下的 ASR 性能评估提供了外部度量。本文介绍了我们基于 Kaldi 的该系统实现,其采用通用音素建模方法进行 ASR,并描述了针对该通用 ASR 系统的极快速适配方案。我们在 NIST LoReHLT 2017 评测数据集上所获得的结果显著优于许多竞争方法的结果。

关键词

引用

@article{arxiv.1802.08731,
  title  = {Automatic Speech Recognition and Topic Identification for Almost-Zero-Resource Languages},
  author = {Matthew Wiesner and Chunxi Liu and Lucas Ondel and Craig Harman and Vimal Manohar and Jan Trmal and Zhongqiang Huang and Najim Dehak and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:1802.08731},
  year   = {2018}
}

备注

Accepted for publication at Interspeech 2018