基于记忆控制的序列到序列语音识别语言模型集成
音频与语音处理
2025-03-05 v2 声音
摘要
本文探讨几种训练 seq2seq 模型以集成预训练 LM 的新方案。我们提出的融合方法聚焦于 seq2seq 解码器长短期记忆(LSTM)中的记忆单元状态与隐藏状态,且不同于先前研究,记忆单元状态由 LM 更新。这意味着主 seq2seq 保留的记忆将被外部 LM 调整。这些融合方法根据该记忆单元更新的架构以及记忆单元与隐藏状态的使用(其直接影响最终标签推断)具有若干变体。我们进行了实验以展示所提方法在 Librispeech 语料上的单语 ASR 设置中以及从多语 ASR(MLASR)基模型到低资源语言的迁移学习设置中的有效性。在 Librispeech 中,我们的最佳模型通过多级解码相对浅融合基线在 test clean、test other 上分别降低 WER 3.7%、2.4%。在从 MLASR 基模型到 IARPA Babel 斯瓦希里语模型的迁移学习中,最佳方案相对 2 阶段迁移基线在 eval 集上于 CER、WER 分别相对降低 9.9%、9.8%。
引用
@article{arxiv.1811.02162,
title = {Language model integration based on memory control for sequence to sequence speech recognition},
author = {Jaejin Cho and Shinji Watanabe and Takaaki Hori and Murali Karthick Baskar and Hirofumi Inaguma and Jesus Villalba and Najim Dehak},
journal= {arXiv preprint arXiv:1811.02162},
year = {2025}
}
备注
4 pages, 1 figure, 5 tables, ICASSP 2019, A notice added to the previous version