将连接主义时间摘要加入 Conformer 以提升其语音识别解码器效率
声音
2022-04-11 v1 计算与语言
音频与语音处理
摘要
Conformer 模型是一种优异的语音识别建模架构,有效利用连接主义时间分类(CTC)与注意力混合损失来训练模型参数。为提升 Conformer 的解码效率,我们提出一种新颖的连接主义时间摘要(CTS)方法,减少注意力解码器从编码器生成的声学序列中所接收的帧数,从而降低计算量。然而,为实现此类解码改进,我们必须微调模型参数,因为交叉注意力观测发生改变,因而需要相应精调。我们的最终实验表明,在束宽为 4 时,LibriSpeech 的解码开销可降低至多 20%,FluentSpeech 数据可降低 11%,且不损失 ASR 精度。在 LibriSpeech “test-other” 集上甚至发现了精度提升:在束宽为 1 时词错误率(WER)相对降低 6%,束宽为 4 时相对降低 3%。
引用
@article{arxiv.2204.03889,
title = {Adding Connectionist Temporal Summarization into Conformer to Improve Its Decoder Efficiency For Speech Recognition},
author = {Nick J. C. Wang and Zongfeng Quan and Shaojun Wang and Jing Xiao},
journal= {arXiv preprint arXiv:2204.03889},
year = {2022}
}
备注
Submitted to INTERSPEECH 2022 (5 pages, 2 figures)