中文

学习发现多类注意区域用于多标签图像识别

计算机视觉与模式识别 2021-07-21 v3

摘要

与单标签图像分类相比,多标签图像识别是一项实用且具有挑战性的任务。然而,以往工作可能因大量目标候选框或复杂的注意区域生成模块而次优。本文中,我们提出一种简洁而高效的两流框架,从全局图像到局部区域识别多类别物体,类似于人类感知物体的方式。为弥合全局与局部流之间的差距,我们提出一个多类注意区域模块,旨在使注意区域数量尽可能少,并保持这些区域的多样性尽可能高。我们的方法能以可接受的计算代价和一个无参数的区域定位模块高效且有效地识别多类物体。在三个多标签图像分类基准上,我们使用仅利用图像语义而无标签依赖的单一模型创造了新的 SOTA 结果。此外,所提方法的有效性在不同因素(如全局池化策略、输入尺寸和网络架构)下得到了广泛验证。代码已发布于 \url{https://github.com/gaobb/MCAR}。

关键词

引用

@article{arxiv.2007.01755,
  title  = {Learning to Discover Multi-Class Attentional Regions for Multi-Label Image Recognition},
  author = {Bin-Bin Gao and Hong-Yu Zhou},
  journal= {arXiv preprint arXiv:2007.01755},
  year   = {2021}
}

备注

13 pages, Accepted by IEEE TIP (5-Jun-2021)