基于Transformer的通用多标签图像分类
计算机视觉与模式识别
2020-12-01 v1 人工智能
机器学习
摘要
多标签图像分类是预测图像中存在的物体、属性或其他实体对应标签集合的任务。本工作中我们提出分类Transformer(C-Tran),一个利用Transformer挖掘视觉特征与标签间复杂依赖关系的通用多标签图像分类框架。我们的方法由一个Transformer编码器构成,该编码器在给定输入掩码标签集合与来自卷积神经网络的视觉特征时被训练以预测目标标签集合。我们方法的关键要素是一个标签掩码训练目标,其使用三值编码方案在训练中将标签状态表示为正、负或未知。我们的模型在COCO和Visual Genome等具有挑战性的数据集上展示了最先进的性能。此外,由于我们的模型在训练中显式表示标签的不确定性,它具有更好的通用性,允许我们在推理时对具有部分或额外标签标注的图像产生改进结果。我们在COCO、Visual Genome、News500和CUB图像数据集中展示了这一附加能力。
引用
@article{arxiv.2011.14027,
title = {General Multi-label Image Classification with Transformers},
author = {Jack Lanchantin and Tianlu Wang and Vicente Ordonez and Yanjun Qi},
journal= {arXiv preprint arXiv:2011.14027},
year = {2020}
}
备注
13 pages, 7 figures