面对视觉损坏的室内场景图像识别
计算机视觉与模式识别
2024-08-26 v1
摘要
室内场景分类是诸多应用中的关键组成部分,如智能机器人助理生活。尽管深度学习显著推进了该领域,但模型常因图像损坏而导致性能下降。本文提出一种创新方法,通过多模态数据融合实现室内场景识别,将基于标题的语义特征与视觉数据集成,以提升准确率和对损坏的鲁棒性。我们检查了两种多模态网络,这些网络通过图卷积网络 (GCN) 将 CNN 模型的视觉特征与语义标题融合。我们的研究表明,这种融合在 Places365 数据集的损坏子集上显著提高了模型性能,Top-1 准确率提升显著。此外,尽管独立的视觉模型在未损坏图像上表现高准确,但在损坏程度增加时性能恶化。相比之下,多模态模型在干净条件下表现更好,并对各种图像损坏具有显著鲁棒性。这些结果凸显了通过标题包含高阶上下文信息的有效性,为增强分类系统的韧性指明了有前景的方向。
引用
@article{arxiv.2408.13029,
title = {Indoor scene recognition from images under visual corruptions},
author = {Willams de Lima Costa and Raul Ismayilov and Nicola Strisciuglio and Estefania Talavera Martinez},
journal= {arXiv preprint arXiv:2408.13029},
year = {2024}
}