基于原始目标查询的视觉Transformer用于多标签图像分类
计算机视觉与模式识别
2022-05-17 v2
摘要
多标签图像分类旨在预测一组可视为无序序列数据的类标签。Transformer将序列数据作为一个整体进行处理,因此天生擅长集合预测。首个基于视觉的Transformer模型是为目标检测任务提出的,其引入了目标查询的概念。目标查询是可学习的positional encodings(位置编码),解码器层中的注意力模块利用图像中的感兴趣区域来解码目标类别或边界框。然而,将同一组目标查询输入到不同的解码器层会阻碍训练:导致性能下降并延迟收敛。本文中,我们提出使用仅在Transformer解码器栈起始处提供的原始目标查询(primal object queries)。此外,我们改进了为多标签分类提出的mixup技术。所提出的带原始目标查询的Transformer模型在MS-COCO和NUS-WIDE数据集上分别将SOTA的类别级F1指标提升了2.1%和1.8%,并将收敛速度加快了79.0%和38.6%。
引用
@article{arxiv.2112.05485,
title = {Visual Transformers with Primal Object Queries for Multi-Label Image Classification},
author = {Vacit Oguz Yazici and Joost van de Weijer and Longlong Yu},
journal= {arXiv preprint arXiv:2112.05485},
year = {2022}
}
备注
Accepted to ICPR 2022