CIF:用于端到端语音识别的连续积分触发机制
计算与语言
2020-02-13 v4 机器学习
神经与进化计算
声音
音频与语音处理
摘要
本文提出一种用于序列转导的新型软单调对齐机制。其受脉冲神经网络中积分触发模型的启发,并应用于由连续函数构成的编码器-解码器框架,故命名为:连续积分触发(CIF)。应用于 ASR 任务时,CIF 不仅计算简洁,且支持在线识别与声学边界定位,因而适用于多种 ASR 场景。我们还提出了若干支撑策略以缓解基于 CIF 模型的特有性问题。在这些方法的共同作用下,基于 CIF 的模型展现出具有竞争力的性能。值得注意的是,其在 Librispeech 的 test-clean 上取得了 2.86% 的词错误率(WER),并在中文电话 ASR 基准上创造了新的 SOTA 结果。
引用
@article{arxiv.1905.11235,
title = {CIF: Continuous Integrate-and-Fire for End-to-End Speech Recognition},
author = {Linhao Dong and Bo Xu},
journal= {arXiv preprint arXiv:1905.11235},
year = {2020}
}
备注
To appear at ICASSP 2020