中文

MlTr:基于 Transformer 的多标签分类

计算机视觉与模式识别 2021-06-14 v1

摘要

多标签图像分类任务是识别图像中呈现的所有物体标签。尽管多年来不断进步,先前的基于卷积神经网络(CNN)的模型仍受限于卷积核的表征能力,小物体、相似物体以及具有高条件概率的物体仍是其主要瓶颈。近期的视觉 transformer 网络利用自注意力机制提取像素粒度的特征,其表达了更丰富的局部语义信息,但在挖掘全局空间依赖上尚显不足。本文指出了基于 CNN 的方法所遇到的三个关键问题,并探索了采用特定 transformer 模块解决它们的可能性。我们提出了一种由窗口划分、窗内像素注意力和跨窗口注意力构建的多标签 Transformer 架构(MlTr),尤其提升了多标签图像分类任务的性能。所提 MlTr 在 MS-COCO、Pascal-VOC 和 NUS-WIDE 等多种主流多标签数据集上分别取得了 88.5%、95.8% 和 65.5% 的 SOTA 结果。代码将很快发布于 https://github.com/starmemda/MlTr/

关键词

引用

@article{arxiv.2106.06195,
  title  = {MlTr: Multi-label Classification with Transformer},
  author = {Xing Cheng and Hezheng Lin and Xiangyu Wu and Fan Yang and Dong Shen and Zhongyuan Wang and Nian Shi and Honglin Liu},
  journal= {arXiv preprint arXiv:2106.06195},
  year   = {2021}
}