基于物体性、属性与类别学习的场景识别
计算机视觉与模式识别
2022-07-22 v1 人工智能
摘要
场景分类已被确立为一个具有挑战性的研究问题。与单个物体的图像相比,场景图像在语义上可能更为复杂和抽象。它们的区别主要在于识别的粒度层次。然而,图像识别是场景识别良好表现的关键支柱,因为从物体图像中获得的知识可用于准确识别场景。现有场景识别方法仅考虑场景的类别标签。然而,我们发现包含详细局部描述的上下文信息也有助于使场景识别模型更具判别力。本文旨在利用物体中编码的属性和类别标签信息改进场景识别。基于属性与类别标签的互补性,我们提出了一种多任务属性-场景识别(MASR)网络,该网络学习类别嵌入并同时预测场景属性。属性获取与物体标注是繁琐且耗时的任务。我们通过提出一种部分监督标注策略来解决该问题,其中人为干预被显著减少。该策略为真实场景提供了更具成本效益的解决方案,并大幅降低了标注工作量。此外,我们根据物体检测分数所指示的重要程度对属性预测进行重新加权。利用所提方法,我们为四个大规模数据集高效标注了属性标签,并系统研究了场景与属性识别如何相互受益。实验结果表明,与最先进的方法相比,MASR学习了更具判别力的表示并取得了有竞争力的识别性能。
引用
@article{arxiv.2207.10174,
title = {Scene Recognition with Objectness, Attribute and Category Learning},
author = {Ji Zhang and Jean-Paul Ainam and Li-hui Zhao and Wenai Song and Xin Wang},
journal= {arXiv preprint arXiv:2207.10174},
year = {2022}
}