Qifusion-Net:面向端到端多方言语音识别的层适应流/非流模型
声音
2024-07-04 v1 人工智能
音频与语音处理
摘要
目前的端到端(E2E)语音识别方法已取得显著性能。然而,自动语音识别(ASR)模型在准确识别多方言语音方面仍面临挑战。我们提出了一种层适应融合(LAF)模型,命名为 Qifusion-Net,不需要对目标方言进行任何先验知识。基于动态块策略,我们的方法实现了流式解码并可提取帧级声学特征,促进细粒度信息融合。实验结果表明,我们提出的方法在 KeSpeech 和 MagicData-RMAC 上的多方言测试数据集上相对于基线模型在字符错误率(CER)上分别降低了 22.1% 和 17.2%。
关键词
引用
@article{arxiv.2407.03026,
title = {Qifusion-Net: Layer-adapted Stream/Non-stream Model for End-to-End Multi-Accent Speech Recognition},
author = {Jinming Chen and Jingyi Fang and Yuanzhong Zheng and Yaoxuan Wang and Haojun Fei},
journal= {arXiv preprint arXiv:2407.03026},
year = {2024}
}
备注
accpeted by interspeech 2014, 5 pages, 1 figure