基于预训练遮蔽语言模型的端到端语音识别
音频与语音处理
2024-10-02 v1
摘要
我们提出了一种新的端到端自动语音识别(ASR)方法,利用预训练遮蔽语言模型(LMs)来促进语言信息的提取。提出的模型包括 BERT-CTC 和 BECTRA,专为有效整合预训练语言模型(如 BERT)到端到端 ASR 模型中而设计。BERT-CTC 通过解决输出标记之间条件独立假设的约束,使 BERT 适用于连接时分类(CTC)。这使得能够在 ASR 过程中对 BERT 的上下文化嵌入进行显式条件化,通过迭代细化算法无缝整合音频和语言信息。BECTRA 将 BERT-CTC 扩展到 transducer 框架,并使用适合 ASR 训练的词汇表训练解码器网络。这旨在桥接 ASR 中的文本与 BERT 之间的差距,因为这两种模型具有不同的词汇表,文本格式和样式不同,例如标点符号的存在。在各种 ASR 任务上的实验结果表明,所提出的模型由于纳入了 BERT 知识,优于 CTC 和 transducer 基线。此外,我们的深入分析和检验验证了所提出公式和架构设计的有效性。
引用
@article{arxiv.2410.00528,
title = {End-to-End Speech Recognition with Pre-trained Masked Language Model},
author = {Yosuke Higuchi and Tetsuji Ogawa and Tetsunori Kobayashi and Shinji Watanabe},
journal= {arXiv preprint arXiv:2410.00528},
year = {2024}
}