中文

基于混合注意力的编解码模型用于高效语言模型自适应

音频与语音处理 2024-09-17 v2 计算与语言 声音

摘要

基于注意力机制的编解码器(AED)语音识别模型近年来已获得广泛成功。然而,以端到端方式对声学模型与语言模型进行联合优化,给文本自适应带来了挑战。特别是,利用文本输入进行有效、快速且低成本的自适应,已成为在工业中部署AED系统的主要关切。为解决此问题,我们提出了一种新颖的模型——混合注意力编解码器(HAED)语音识别模型,其保留了传统混合自动语音识别系统的模块化特性。我们的HAED模型将声学模型与语言模型分离,从而可使用传统的基于文本的语言模型自适应技术。我们证明,当使用域外文本数据进行语言模型自适应时,所提出的HAED模型取得了23%的相对词错误率(WER)提升,且在通用测试集上相较于传统AED模型仅有微小的WER退化。

关键词

引用

@article{arxiv.2309.07369,
  title  = {Hybrid Attention-based Encoder-decoder Model for Efficient Language Model Adaptation},
  author = {Shaoshi Ling and Guoli Ye and Rui Zhao and Yifan Gong},
  journal= {arXiv preprint arXiv:2309.07369},
  year   = {2024}
}