面向多标签图像分类的多层语义表示网络
计算机视觉与模式识别
2023-10-10 v1 人工智能
摘要
多标签图像分类(MLIC)是一项基础且实用的任务,旨在为图像分配多个可能标签。近年来,许多基于深度卷积神经网络(CNN)的方法被提出,通过建模标签相关性来发掘标签语义并学习图像的语义表示。本文通过同时改进标签相关性建模与语义表示学习推进该研究方向。一方面,除每个标签的局部语义外,我们提出进一步探索多个标签共享的全局语义。另一方面,现有方法主要在 CNN 的最后一层卷积层学习语义表示。但已注意到,CNN 不同层的图像表示捕捉不同层次或尺度的特征并具备不同判别能力。因此我们提出在多个卷积层学习语义表示。为此,本文设计了一种多层语义表示网络(MSRN),通过建模标签相关性发掘标签的局部与全局语义,并利用标签语义通过注意力机制引导多层语义表示学习。在 VOC 2007、COCO、NUS-WIDE 和 Apparel 四个基准数据集上的大量实验表明,所提 MSRN 相较最先进模型具有竞争力。
引用
@article{arxiv.2106.11596,
title = {Multi-layered Semantic Representation Network for Multi-label Image Classification},
author = {Xiwen Qu and Hao Che and Jun Huang and Linchuan Xu and Xiao Zheng},
journal= {arXiv preprint arXiv:2106.11596},
year = {2023}
}