Nextformer:一种用于端到端语音识别的 ConvNeXt 增强型 Conformer
音频与语音处理
2022-07-01 v2 信号处理
摘要
Conformer 模型在端到端语音识别中已取得最先进(SOTA)结果。然而 Conformer 主要关注时序建模,对语音特征的时频特性关注较少。本文以 ConvNeXt 增强 Conformer 并提出 Nextformer 结构。我们使用堆叠的 ConvNeXt 块替换 Conformer 中常用的下采样模块,以利用时频语音特征所含信息。此外,我们在 Conformer 层中间插入额外的下采样模块,使模型更高效且更准确。我们在两个公开数据集 AISHELL-1 与 WenetSpeech 上实验。在 AISHELL-1 上,相较 Conformer 基线,Nextformer 在非流式与流式模式下分别获得 7.3% 与 6.3% 的相对 CER 降低;在更大的 WenetSpeech 数据集上,Nextformer 在非流式与流式模式下分别给出 5.0%~6.5% 与 7.5%~14.6% 的相对 CER 降低,而计算代价 FLOPs 与 Conformer 相当。据我们所知,所提 Nextformer 模型在 AISHELL-1(CER 4.06%)与 WenetSpeech(CER 7.56%/11.29%)上达到了 SOTA 结果。
引用
@article{arxiv.2206.14747,
title = {Nextformer: A ConvNeXt Augmented Conformer For End-To-End Speech Recognition},
author = {Yongjun Jiang and Jian Yu and Wenwen Yang and Bihong Zhang and Yanfeng Wang},
journal= {arXiv preprint arXiv:2206.14747},
year = {2022}
}
备注
5 pages, 1 figure