基于注意力神经网络融合的噪声容忍音视频在线人员验证
计算机视觉与模式识别
2018-11-28 v1 音频与语音处理
摘要
本文提出一种利用语音与视觉信号的多模态在线人员验证系统。受神经科学关于声音与面孔关联发现的启发,我们提出一种基于注意力的端到端神经网络,其为人员验证任务学习多感官关联。我们所提网络中的注意力机制学习在语音与面部表示之间有条件地选择显著模态,从而在互补输入间提供平衡。凭借此能力,该网络对任一模态的缺失或 corrupted 数据具有鲁棒性。在 VoxCeleb2 数据集上,我们表明我们的方法相对于竞争的多模态方法表现更优。即便对于大尺度 corruption 或完全缺失模态的极端情况,我们的方法也展现出优于其他单模态方法的鲁棒性。
引用
@article{arxiv.1811.10813,
title = {Noise-tolerant Audio-visual Online Person Verification using an Attention-based Neural Network Fusion},
author = {Suwon Shon and Tae-Hyun Oh and James Glass},
journal= {arXiv preprint arXiv:1811.10813},
year = {2018}
}