中文

端到端音视觉语音识别中信息流的融合

音频与语音处理 2021-04-20 v1 声音

摘要

端到端声学语音识别已迅速获得广泛欢迎,并在许多研究中展现出有前景的结果。具体而言,联合transformer/CTC模型在许多任务上提供了非常好的性能。然而,在噪声和失真条件下,性能仍显著下降。虽然音视觉语音识别可显著改善此类恶劣条件下端到端模型的识别率,但在这些模型中如何最佳地利用关于声学与视觉信号质量及可靠性的可用信息尚不明显。因此我们考量如何最优地将声学与视觉信息流的任何时变可靠性告知transformer/CTC模型。我们提出了一种新的融合策略,在决策融合网络中结合可靠性信息,该网络考虑了注意力机制的时间效应。相较于LRS2和LRS3(Lip Reading Sentences 2和3)语料库上最先进的基线模型,该方法取得了显著改进。新系统平均实现了相对词错误率相比纯音频设置降低43%、相比音视觉端到端基线降低31%。

关键词

引用

@article{arxiv.2104.09482,
  title  = {Fusing information streams in end-to-end audio-visual speech recognition},
  author = {Wentao Yu and Steffen Zeiler and Dorothea Kolossa},
  journal= {arXiv preprint arXiv:2104.09482},
  year   = {2021}
}

备注

5 pages