语义感知的场景识别
计算机视觉与模式识别
2020-02-28 v3
摘要
场景识别目前是计算机视觉中最具挑战性的研究领域之一。这可能是由于类间歧义所致:若干场景类的图像可能共享相似物体,从而导致它们之间的混淆。当某一特定场景类的图像差异显著时,该问题更加严重。卷积神经网络(CNNs)已显著提升了场景识别性能,尽管其仍远低于其他识别任务(例如物体或图像识别)。在本文中,我们描述了一种基于端到端多模态 CNN 的新颖场景识别方法,该方法通过注意力模块结合图像与上下文信息。以语义分割形式出现的上下文信息,通过利用语义表示中编码的信息(场景物体与素材及其相对位置之集合)来门控从 RGB 图像提取的特征。该门控过程强化了指示性场景内容的学习,并通过将 CNN 的感受野重新聚焦于这些内容来增强场景消歧。在四个公开可用数据集上的实验结果表明,所提方法优于所有其他最先进方法,同时显著减少了网络参数数量。本文所用全部代码与数据可在 https://github.com/vpulab/Semantic-Aware-Scene-Recognition 获取。
引用
@article{arxiv.1909.02410,
title = {Semantic-Aware Scene Recognition},
author = {Alejandro López-Cifuentes and Marcos Escudero-Viñolo and Jesús Bescós and Álvaro García-Martín},
journal= {arXiv preprint arXiv:1909.02410},
year = {2020}
}
备注
Paper submitted for publication to Elsevier Pattern Recognition journal