InterFormer:用于自动语音识别的局部与全局特征交互融合模型
计算与语言
2023-05-30 v2 人工智能
声音
音频与语音处理
摘要
局部与全局特征对自动语音识别(ASR)均至关重要。许多近期方法已验证,简单结合局部与全局特征可进一步提升 ASR 性能。然而,这些方法较少关注局部与全局特征的交互,且其串行架构难以灵活反映局部与全局关系。为解决这些问题,本文提出 InterFormer,用于局部与全局特征的交互融合,以学习更好的 ASR 表征。具体而言,我们将卷积块与 transformer 块以并行设计结合。此外,我们提出双向特征交互模块(BFIM)与选择性融合模块(SFM),分别实现局部与全局特征的交互与融合。在公开 ASR 数据集上的大量实验证明了我们所提 InterFormer 的有效性,以及其优于其他 Transformer 和 Conformer 模型的性能。
引用
@article{arxiv.2305.16342,
title = {InterFormer: Interactive Local and Global Features Fusion for Automatic Speech Recognition},
author = {Zhi-Hao Lai and Tian-Hao Zhang and Qi Liu and Xinyuan Qian and Li-Fang Wei and Song-Lu Chen and Feng Chen and Xu-Cheng Yin},
journal= {arXiv preprint arXiv:2305.16342},
year = {2023}
}
备注
Accepted by Interspeech 2023