中文

看与听:面向自主机器场景分类的多模态后期融合方法

计算机视觉与模式识别 2020-07-21 v1 机器学习 声音 音频与语音处理

摘要

本研究的新颖之处在于一种多模态场景分类方法,其中图像与音频在深度后期融合过程中相互补充。该方法在一个困难分类问题上得到验证,该问题由两组同步且均衡的数据集构成,含 16,000 个数据对象,涵盖 8 种相似度各异环境的 4.4 小时视频。我们首先以一秒间隔提取视频帧与伴随音频。图像与音频数据集先分别使用微调的 VGG16 与进化优化深度神经网络独立分类,准确率分别为 89.27% 与 93.72%。随后对两个神经网络进行后期融合以实现更高阶函数,在该同步视频帧与音频片段的多模态分类器中达到 96.81% 的准确率。为实现后期融合的三级神经网络,在将两个初级网络视作特征生成器时,较经典最优分类器高出约 3%。我们表明,单一模态可能被异常数据点混淆的情形,现通过涌现的高阶整合得以纠正。显著例子包括:城市中水景被音频分类器单独误判为河流,以及拥挤街道被图像分类器单独误判为森林。二者均被我们的多模态方法正确分类。

关键词

引用

@article{arxiv.2007.10175,
  title  = {Look and Listen: A Multi-modality Late Fusion Approach to Scene Classification for Autonomous Machines},
  author = {Jordan J. Bird and Diego R. Faria and Cristiano Premebida and Anikó Ekárt and George Vogiatzis},
  journal= {arXiv preprint arXiv:2007.10175},
  year   = {2020}
}

备注

6 pages, 10 figures, 3 tables