中文

LV-CTC:基于 CTC 与隐变量模型的非自回归 ASR

音频与语音处理 2024-03-29 v1

摘要

用于自动语音识别 (ASR) 的非自回归 (NAR) 模型旨在通过简化传统模型的自回归 (AR) 生成过程来实现高精度与快速推理。连接时序分类 (CTC) 是 NAR ASR 模型中使用的关键技术之一。在本文中,我们提出了一种结合 CTC 与隐变量模型的新模型,后者是神经机器翻译研究领域中最先进的模型之一。我们引入了专为 ASR 应用设计的新型神经网络架构与公式化表达。在所提出的模型中,假设 CTC 对齐依赖于预期可捕获 token 间依赖关系的隐变量。在 Librispeech 语料库 100 小时子集上的实验结果表明,该方法在基于 CTC 的 NAR 模型中取得了最佳识别准确率。在 TED-LIUM2 语料库上,包括 AR E2E 模型在内,该方法以更快的推理速度实现了最佳识别准确率。

关键词

引用

@article{arxiv.2403.19207,
  title  = {LV-CTC: Non-autoregressive ASR with CTC and latent variable models},
  author = {Yuya Fujita and Shinji Watanabe and Xuankai Chang and Takashi Maekaku},
  journal= {arXiv preprint arXiv:2403.19207},
  year   = {2024}
}