基于LSTM的端到端音视频融合
计算机视觉与模式识别
2017-09-14 v1
摘要
近来提出了若干端到端深度学习方法,它们同时从输入图像提取视觉特征并进行视觉语音分类。然而,关于联合提取音频与视觉特征并进行分类的研究非常有限。本工作中,我们提出一种基于双向长短期记忆(BLSTM)网络的端到端音视频模型。据我们所知,这是首个音视频融合模型,它同时学习直接从像素与频谱图提取特征,并对语音与非语言发声进行分类。该模型由多个相同的流组成,每种模态一个,直接从嘴部区域与频谱图提取特征。每个流/模态中的时间动态由BLSTM建模,多流/模态的融合通过另一个BLSTM进行。在AVIC数据库上,相较于仅音频分类,4种非语言发声的平均F1绝对值提升1.9%。同时,所提出的端到端音视频融合系统在AVIC数据库上改进了最先进性能,使平均F1度量绝对提升9.7%。我们还在OuluVS2数据库上使用嘴部不同视角(正面到侧面)进行了音视频语音识别实验。当声学噪声较高时,所提出的音视频系统在所有视角下均显著优于仅音频模型。
引用
@article{arxiv.1709.04343,
title = {End-to-End Audiovisual Fusion with LSTMs},
author = {Stavros Petridis and Yujiang Wang and Zuwei Li and Maja Pantic},
journal= {arXiv preprint arXiv:1709.04343},
year = {2017}
}
备注
Accepted to AVSP 2017. arXiv admin note: substantial text overlap with arXiv:1709.00443 and text overlap with arXiv:1701.05847