中文

面向端到端语音识别与理解的语音与语言隐空间对齐优化

声音 2021-10-26 v1 音频与语音处理

摘要

基于注意力的编码器-解码器(AED)网络的进展为端到端(E2E)自动语音识别(ASR)带来了巨大进步。进一步提升基于AED的E2E ASR性能的一种方法是引入额外的文本编码器以利用大量文本数据,从而捕获更具上下文感知的语言信息。然而,由于建模所用单元不同,该方法带来了语音编码器与文本编码器之间的不匹配问题。本文中,我们提出一种嵌入对齐器与模态切换训练,以更好地对齐语音与文本隐空间。嵌入对齐器是文本编码器与语音编码器之间共享的线性投影,分别由掩码语言建模(MLM)损失与连接主义时序分类(CTC)训练。模态切换训练基于强制对齐结果随机交换语音与文本嵌入,以学习联合表示空间。实验结果表明,我们所提方法在Librispeech ASR任务上实现了14%至19%的相对词错误率(WER)降低。我们进一步在口语理解(SLU)上验证其有效性,即在SNIPS槽填充任务上取得2.5%至2.8%的绝对F1分数提升。

关键词

引用

@article{arxiv.2110.12138,
  title  = {Optimizing Alignment of Speech and Language Latent Spaces for End-to-End Speech Recognition and Understanding},
  author = {Wei Wang and Shuo Ren and Yao Qian and Shujie Liu and Yu Shi and Yanmin Qian and Michael Zeng},
  journal= {arXiv preprint arXiv:2110.12138},
  year   = {2021}
}

备注

submitted to ICASSP 2022