基于 Transformer 的鲁棒语音识别中注意力融合增强的音视频编码
音频与语音处理
2020-08-07 v1 机器学习
多媒体
声音
摘要
音视频信息融合能够提升在复杂声学场景(如噪声环境)下的语音识别性能。需要探索一种有效的音视频融合策略以实现音视频对齐与模态可靠性。不同于以往在各自模态编码后执行音视频融合的端到端方法,本文提出将注意力融合模块集成到编码过程中。研究表明,由于在编码模块中利用了两模态间的相关性,所提出的音视频融合方法能够丰富音视频表征。结合基于 Transformer 的架构,我们使用基于多头注意力的单向或双向交互音视频融合实现了嵌入式融合模块。所提方法能够充分结合两路流并削弱对音频模态的过度依赖。在 LRS3-TED 数据集上的实验表明,与最先进方法相比,所提方法在干净、已见噪声和未见噪声条件下平均分别将识别率提升了 0.55%、4.51% 和 4.61%。
引用
@article{arxiv.2008.02686,
title = {Attentive Fusion Enhanced Audio-Visual Encoding for Transformer Based Robust Speech Recognition},
author = {Liangfa Wei and Jie Zhang and Junfeng Hou and Lirong Dai},
journal= {arXiv preprint arXiv:2008.02686},
year = {2020}
}