PyTorch-Kaldi 语音识别工具包
音频与语音处理
2019-02-19 v2 计算与语言
机器学习
神经与进化计算
摘要
开源软件的可用性在语音识别和深度学习的普及中发挥着显著作用。例如,Kaldi 如今已成为用于开发最先进语音识别器的成熟框架。PyTorch 用于以 Python 语言构建神经网络,并因其简洁性和灵活性最近在机器学习社区中引发了巨大兴趣。PyTorch-Kaldi 项目旨在弥合这些流行工具包之间的差距,试图继承 Kaldi 的效率和 PyTorch 的灵活性。PyTorch-Kaldi 不仅是这些软件之间的简单接口,还嵌入了若干用于开发现代语音识别器的有用特性。例如,该代码专门设计用于自然地插入用户自定义的声学模型。作为替代,用户可以利用多个预实现的神经网络,这些网络可使用直观的配置文件进行定制。PyTorch-Kaldi 支持多特征和多标签流以及神经网络的组合,从而支持复杂神经架构的使用。该工具包已公开发布,并附有丰富文档,设计用于本地或 HPC 集群上正常运行。在多个数据集和任务上进行的实验表明,PyTorch-Kaldi 可有效用于开发现代最先进的语音识别器。
关键词
引用
@article{arxiv.1811.07453,
title = {The PyTorch-Kaldi Speech Recognition Toolkit},
author = {Mirco Ravanelli and Titouan Parcollet and Yoshua Bengio},
journal= {arXiv preprint arXiv:1811.07453},
year = {2019}
}
备注
Accepted at ICASSP 2019