CAT:基于 CRF 的语音识别工具包
机器学习
2019-11-21 v1 声音
音频与语音处理
机器学习
摘要
在本文中,我们提出了一个用于自动语音识别(ASR)的新的开源工具包,名为 CAT(基于 CRF 的 ASR 工具包,CRF-based ASR Toolkit)。CAT 的一个关键特征是在条件随机场(CRF)框架下的判别训练,特别是受连接时序分类(CTC)启发的状态拓扑。CAT 包含了 CTC-CRF 的完整实现,并提供了基于 CRF 的端到端语音识别的完整工作流。在 Switchboard 和 Aishell 等中英文基准上的评估结果表明,CAT 在参数更少的情况下取得了现有端到端模型中的最优结果,并且与混合 DNN-HMM 模型相比具有竞争力。在灵活性方面,我们展示了基于 i-vector 的说话人自适应识别和延迟控制机制可以在 CAT 中轻松且有效地进行探索。我们希望 CAT,尤其是基于 CRF 的框架和软件,能引起社区的广泛兴趣,并能被进一步探索和改进。
引用
@article{arxiv.1911.08747,
title = {CAT: CRF-based ASR Toolkit},
author = {Keyu An and Hongyu Xiang and Zhijian Ou},
journal= {arXiv preprint arXiv:1911.08747},
year = {2019}
}
备注
Code released at: https://github.com/thu-spmi/cat