用于跨音频-视觉匹配识别的3D卷积神经网络
计算机视觉与模式识别
2017-11-01 v5
摘要
音频-视觉识别(AVR)已被视为在音频受损时的语音识别任务的解决方案,以及用于多说话人场景下说话人验证的视觉识别方法。AVR系统的方法是利用从一个模态提取的信息,通过补充缺失信息来改善另一模态的识别能力。本质问题在于找到音频与视觉流之间的对应关系,这也是本工作的目标。我们提出使用一种耦合的3D卷积神经网络(3D-CNN)架构,该架构能将两种模态映射到表示空间,以利用学习到的多模态特征评估音视觉流的对应性。所提架构将联合纳入空间和时间信息,以有效发现不同模态时间信息之间的相关性。通过使用相对较小的网络架构和小得多的训练数据集,我们提出的方法在音视觉匹配上超越了使用3D CNN进行特征表示的现有类似方法的性能。我们还证明,有效的配对选择方法能显著提升性能。与最先进的方法相比,所提方法在等错误率(EER)上实现了超过20%的相对提升,在平均精度(AP)上实现了超过7%的相对提升。
引用
@article{arxiv.1706.05739,
title = {3D Convolutional Neural Networks for Cross Audio-Visual Matching Recognition},
author = {Amirsina Torfi and Seyed Mehdi Iranmanesh and Nasser M. Nasrabadi and Jeremy Dawson},
journal= {arXiv preprint arXiv:1706.05739},
year = {2017}
}