中文

基于注意力的音视频融合用于鲁棒自动语音识别

音频与语音处理 2019-05-02 v3 机器学习 声音 图像与视频处理 机器学习

摘要

自动语音识别有可能从唇部运动模式中获益,补充声学语音以改进整体识别性能,尤其在噪声环境下。本文提出一种音视频融合策略,其超越简单的特征拼接,并学习自动对齐两种模态,从而产生增强的表征,在干净和噪声条件下均提高识别准确率。我们在为大规模词汇连续语音识别设计的 TCD-TIMIT 和 LRS2 数据集上测试我们的策略,以不同功率比施加三类噪声。我们还利用了最先进的 Sequence-to-Sequence 架构,表明我们的方法可轻松集成。结果显示,相对于仅声学模态,在 TCD-TIMIT 上根据声学噪声水平的不同取得了 7% 至 30% 的相对提升。我们预期该融合策略可轻易推广至许多涉及相关模态的其他多模态任务。代码已在 GitHub 在线提供:https://github.com/georgesterpu/Sigmedia-AVSR

关键词

引用

@article{arxiv.1809.01728,
  title  = {Attention-based Audio-Visual Fusion for Robust Automatic Speech Recognition},
  author = {George Sterpu and Christian Saam and Naomi Harte},
  journal= {arXiv preprint arXiv:1809.01728},
  year   = {2019}
}

备注

In ICMI'18, October 16-20, 2018, Boulder, CO, USA. Equation (2) corrected on this version