基于 R-Drop 结构的改进 Conformer 端到端语音识别模型研究
声音
2023-06-16 v1 计算与语言
音频与语音处理
摘要
针对深度学习中端到端语音识别模型泛化能力较差的问题,本研究提出了一种结合 R-drop 结构的、基于 Conformer 的新型语音识别模型“Conformer-R”。该模型将已在语音识别中展现出良好效果的 Conformer 模型与 R-drop 结构相结合。借此,模型能够有效建模局部与全局语音信息,同时通过 R-drop 结构降低过拟合,从而增强模型泛化能力并提高整体识别效率。该模型首先在 Aishell1 和 Wenetspeech 数据集上进行预训练以实现通用领域自适应,随后在计算机相关音频数据上微调。在相同测试集上与 LAS、Wenet 等经典模型进行对比测试,结果表明 Conformer-R 模型能够有效提升泛化能力。
引用
@article{arxiv.2306.08329,
title = {Research on an improved Conformer end-to-end Speech Recognition Model with R-Drop Structure},
author = {Weidong Ji and Shijie Zan and Guohui Zhou and Xu Wang},
journal= {arXiv preprint arXiv:2306.08329},
year = {2023}
}
备注
15 pages, 9 figures