通过条件化于中间预测放宽基于 CTC 的 ASR 的条件独立假设
音频与语音处理
2021-10-11 v2 计算与语言
声音
摘要
本文提出一种放宽基于连接主义时序分类(CTC)的自动语音识别(ASR)模型条件独立假设的方法。我们训练一个基于 CTC 的 ASR 模型,除最后一层原有 CTC 损失外,还在中间层加入辅助 CTC 损失。在训练与推理期间,中间层生成的每个预测被求和至下一层输入,以使最后一层预测条件化于那些中间预测。我们的方法易于实现,并保留了基于 CTC 的 ASR 的优点:简单的模型架构与快速解码速度。我们在三个不同 ASR 语料库上实验。所提方法以少许计算开销显著改进标准 CTC 模型(例如,在 WSJ 语料库上相对词错率降低逾 20%)。此外,对 TEDLIUM2 语料库与 AISHELL-1 语料库,其取得与带束搜索的强自回归模型相当的性能,但解码速度至少快 30 倍。
引用
@article{arxiv.2104.02724,
title = {Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions},
author = {Jumon Nozaki and Tatsuya Komatsu},
journal= {arXiv preprint arXiv:2104.02724},
year = {2021}
}
备注
Accepted to INTERSPEECH2021