中文

BERT 遇见 CTC:基于预训练掩码语言模型的端到端语音识别新形式化

音频与语音处理 2023-04-21 v2 计算与语言

摘要

本文提出 BERT-CTC,一种将 BERT 应用于连接时序分类(CTC)的端到端语音识别新形式化。我们的形式化放宽了传统 CTC 中使用条件独立假设,并通过 BERT 上下文嵌入获得的显式输出依赖引入语言知识。BERT-CTC 通过自注意力机制关注输入与假设输出序列的完整上下文。该机制鼓励模型在学习音频与词元表示之间内部/相互依赖的同时,保持 CTC 的训练效率。在推理过程中,BERT-CTC 将掩码预测算法与 CTC 解码相结合,迭代地精炼输出序列。实验结果表明,BERT-CTC 在不同说话风格与语言下均优于传统方法。最后,我们展示了 BERT-CTC 中的语义表示有益于下游口语理解任务。

关键词

引用

@article{arxiv.2210.16663,
  title  = {BERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model},
  author = {Yosuke Higuchi and Brian Yan and Siddhant Arora and Tetsuji Ogawa and Tetsunori Kobayashi and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2210.16663},
  year   = {2023}
}

备注

v1: Accepted to Findings of EMNLP2022, v2: Minor corrections and clearer derivation of Eq. (21)