基于 CIF 的非自回归端到端 ASR 的边界与上下文感知训练
声音
2021-09-28 v2 音频与语音处理
摘要
基于连续积分触发(CIF)的模型采用软且单调的对齐机制,已良好地应用于非自回归(NAR)语音识别中,并与其他 NAR 方法相比具有竞争性能。然而,这种对齐学习策略可能受 erroneous 声学边界估计的困扰,严重阻碍收敛速度及系统性能。本文提出一种针对基于 CIF 的 NAR 模型的边界与上下文感知训练方法。首先,利用连接主义时序分类(CTC)尖峰信息引导 CIF 中声学边界的学习。此外,在 CIF 解码器后引入一个额外的上下文解码器,旨在捕获句内语言依赖。最后,我们采用近期提出的 Conformer 架构以提升声学建模能力。在开源中文 AISHELL-1 语料上的实验表明,所提方法仅以 1/24 延迟取得了 4.9% 的可比字符错误率(CERs),与最先进的自回归(AR)Conformer 模型相当。此外,在内部 7500 小时中文语料上评估时,我们的模型仍优于其他 NAR 方法,并在具有挑战性的真实世界噪声测试集上甚至达到 AR Conformer 模型。
引用
@article{arxiv.2104.04702,
title = {Boundary and Context Aware Training for CIF-based Non-Autoregressive End-to-end ASR},
author = {Fan Yu and Haoneng Luo and Pengcheng Guo and Yuhao Liang and Zhuoyuan Yao and Lei Xie and Yingying Gao and Leijing Hou and Shilei Zhang},
journal= {arXiv preprint arXiv:2104.04702},
year = {2021}
}
备注
5 pages,4 figures