CIF-T:一种用于自动语音识别的基于CIF的新型Transducer架构
声音
2024-11-28 v4 计算与语言
音频与语音处理
摘要
RNN-T模型广泛用于ASR,其依赖RNN-T损失实现输入音频与目标序列之间的长度对齐。然而,RNN-T损失的实现复杂度和基于对齐的优化目标分别导致了计算冗余并削弱了predictor网络的作用。本文中,我们提出一种名为CIF-Transducer(CIF-T)的新型模型,它将连续积分触发(CIF)机制与RNN-T模型结合以实现高效对齐。通过这种方式,RNN-T损失被舍弃,从而带来计算量的减少并允许predictor网络发挥更重要的作用。我们还引入了Funnel-CIF、上下文块、统一门控与双线性池化联合网络以及辅助训练策略以进一步提升性能。在178小时AISHELL-1和10000小时WenetSpeech数据集上的实验表明,与RNN-T模型相比,CIF-T以更低的计算开销取得了最先进的(SOTA)结果。
引用
@article{arxiv.2307.14132,
title = {CIF-T: A Novel CIF-based Transducer Architecture for Automatic Speech Recognition},
author = {Tian-Hao Zhang and Dinghao Zhou and Guiping Zhong and Jiaming Zhou and Baoxiang Li},
journal= {arXiv preprint arXiv:2307.14132},
year = {2024}
}
备注
Accepted by ICASSP 2024