中文

基于门控信息融合网络的鲁棒深度多模态学习

计算机视觉与模式识别 2018-11-05 v2

摘要

多模态学习的目标是利用多个模态提供的相关任务上的互补信息,以实现可靠且鲁棒的性能。近来,深度学习通过在中间特征层面进行信息融合,显著提升了多模态学习。本文解决了在不完美模态存在下设计鲁棒深度多模态学习架构的问题。我们引入了用于目标检测的深度融合架构,其使用独立的卷积神经网络(CNN)处理每个模态,并通过组合来自 CNN 的中间特征构建联合特征图。为促进对退化模态的鲁棒性,我们采用门控信息融合(GIF)网络,根据待融合的输入特征图对每个模态的贡献进行加权。权重通过卷积层后接 sigmoid 函数确定,并与信息融合网络以端到端方式一同训练。我们的实验表明,所提出的 GIF 网络提供了额外的架构灵活性,以在处理某些退化模态时实现鲁棒性能,并基于 Single Shot Detector (SSD) 在使用所提出的融合网络和数据增强方案时在 KITTI 数据集上显示出显著的性能提升。

关键词

引用

@article{arxiv.1807.06233,
  title  = {Robust Deep Multi-modal Learning Based on Gated Information Fusion Network},
  author = {Jaekyum Kim and Junho Koh and Yecheol Kim and Jaehyung Choi and Youngbae Hwang and Jun Won Choi},
  journal= {arXiv preprint arXiv:1807.06233},
  year   = {2018}
}

备注

2018 Asian Conference on Computer Vision (ACCV)