面向端到端音视觉语音识别的模态注意力
计算与语言
2019-04-24 v2 计算机视觉与模式识别
声音
音频与语音处理
摘要
音视觉语音识别(AVSR)系统被认为是鲁棒语音识别最有前景的解决方案之一,尤其在噪声环境下。本文提出一种基于多模态注意力的音视觉语音识别新方法,可根据各模态的重要性自动学习其融合表示。我们的方法采用最先进的序列到序列(Seq2seq)架构实现。实验结果表明,相对于仅使用听觉模态,在不同信噪比(SNR)下可获得 2% 至 36% 的相对提升。与传统特征拼接方法相比,我们所提方法在干净与噪声条件下均能取得更好的识别性能。我们相信基于模态注意力的端到端方法可轻松推广至其他具有相关信息的多模态任务。
引用
@article{arxiv.1811.05250,
title = {Modality Attention for End-to-End Audio-visual Speech Recognition},
author = {Pan Zhou and Wenwen Yang and Wei Chen and Yanfeng Wang and Jia Jia},
journal= {arXiv preprint arXiv:1811.05250},
year = {2019}
}
备注
accepted by ICASSP2019