由粗至精:基于全局/局部注意力的多标签图像分类
计算机视觉与模式识别
2020-12-29 v1
摘要
在日常生活中,我们周围的场景总是带有多个标签,尤其在智慧城市中,即识别城市运行信息以做出响应与控制。人们已做出大量努力利用深度神经网络来识别多标签图像。由于多标签图像分类非常复杂,人们寻求使用注意力机制来引导分类过程。然而,传统的基于注意力的方法总是直接且激进地分析图像,难以很好地理解复杂场景。本文中,我们提出一种全局/局部注意力方法,通过模仿人类观察图像的方式由粗至精地识别图像。具体而言,我们的全局/局部注意力方法首先关注整幅图像,然后聚焦于图像中的局部特定对象。我们还提出一种联合最大间隔目标函数,其在水平与垂直方向上强制正标签的最小得分应大于负标签的最大得分。该函数可进一步提升我们的多标签图像分类方法。我们在两个流行的多标签图像数据集(即Pascal VOC与MS-COCO)上评估了方法的有效性。实验结果表明,我们的方法优于当前最优(SOTA)方法。
引用
@article{arxiv.2012.13662,
title = {Coarse to Fine: Multi-label Image Classification with Global/Local Attention},
author = {Fan Lyu and Fuyuan Hu and Victor S. Sheng and Zhengtian Wu and Qiming Fu and Baochuan Fu},
journal= {arXiv preprint arXiv:2012.13662},
year = {2020}
}
备注
Accepted by IEEE International Smart Cities Conference 2018