中文

PyKaldi2:又一个基于 Kaldi 和 PyTorch 的语音工具包

计算与语言 2019-10-25 v3 音频与语音处理

摘要

我们介绍了基于 Kaldi 和 PyTorch 实现的 PyKaldi2 语音识别工具包。尽管已有基于这两者构建的类似工具包,但 PyKaldi2 的一个关键特征是使用 MMI、sMBR 和 MPE 等准则进行序列训练。具体而言,我们实现了在模型训练期间即时生成词格的序列训练模块,以简化训练流程。为了应对实际应用中具有挑战性的声学环境,PyKaldi2 还支持即时噪声与混响仿真,以提高模型的鲁棒性。借助此功能,可以将梯度从序列级损失反向传播至前端特征提取模块,这有望促进前端与后端联合学习方向上的更多研究。我们在 Librispeech 上进行了基准实验,并表明 PyKaldi2 能够达到合理的识别准确率。该工具包在 MIT 许可证下发布。

关键词

引用

@article{arxiv.1907.05955,
  title  = {PyKaldi2: Yet another speech toolkit based on Kaldi and PyTorch},
  author = {Liang Lu and Xiong Xiao and Zhuo Chen and Yifan Gong},
  journal= {arXiv preprint arXiv:1907.05955},
  year   = {2019}
}

备注

5 pages, 2 figures, submitted to ICASSP 2020