判别性多模态语音识别
计算机视觉与模式识别
2020-05-14 v2 计算与语言
声音
音频与语音处理
图像与视频处理
摘要
视觉常被用作音频语音识别 (ASR) 的互补模态,尤其在噪声环境中,单一音频模态的性能会显著恶化。结合视觉模态后,ASR 升级为多模态语音识别 (MSR)。本文提出一种两阶段语音识别模型。第一阶段,借助唇动对应的视觉信息将目标语音从背景噪声中分离,使模型“听清”。第二阶段,音频模态再次结合视觉模态,通过 MSR 子网络更好地理解语音,进一步提高识别率。其他关键贡献包括:我们引入基于伪三维残差卷积 (P3D) 的视觉前端以提取更具判别性的特征;我们将时间卷积块由 1D ResNet 升级为时间卷积网络 (TCN),其更适用于时序任务;MSR 子网络构建于逐元素注意力门控循环单元 (EleAtt-GRU) 之上,其在长序列上比 Transformer 更有效。我们在 LRS3-TED 和 LRW 数据集上进行了大量实验。我们的两阶段模型(音频增强多模态语音识别,AE-MSR)始终以显著优势取得最先进的性能,证明了 AE-MSR 的必要性与有效性。
引用
@article{arxiv.2005.05592,
title = {Discriminative Multi-modality Speech Recognition},
author = {Bo Xu and Cheng Lu and Yandong Guo and Jacob Wang},
journal= {arXiv preprint arXiv:2005.05592},
year = {2020}
}
备注
CVPR2020