中文

结合度量学习与注意力头实现准确高效的多标签图像分类

计算机视觉与模式识别 2022-12-21 v2

摘要

多标签图像分类可从给定图像中预测一组标签。与每张图像仅分配一个标签的多类分类不同,这种设定适用于更广泛的应用场景。本文重新审视了两种流行的多标签分类方法:基于Transformer的头部与标签关系信息图处理分支。尽管基于Transformer的头部被认为比基于图的分支取得更好的结果,我们认为在适当的训练策略下,基于图的方法仅表现出微小的精度下降,同时在推理时消耗更少的计算资源。在我们的训练策略中,我们引入了非对称损失(Asymmetric Loss, ASL)的度量学习变体,以替代作为多标签分类事实标准的ASL。在每个二分类子问题中,它对来自骨干网络的L2L_2归一化特征向量进行处理,并迫使正样本与负样本的归一化表示之间的角度尽可能大。这比在未归一化特征上使用二元交叉熵损失提供了更好的判别能力。借助所提出的损失与训练策略,我们在MS-COCO、PASCAL-VOC、NUS-Wide和Visual Genome 500等广泛使用的多标签分类基准上取得了单模态方法中的SOTA结果。我们的方法源代码作为OpenVINO Training Extensions的一部分提供:https://github.com/openvinotoolkit/deep-object-reid/tree/multilabel

关键词

引用

@article{arxiv.2209.06585,
  title  = {Combining Metric Learning and Attention Heads For Accurate and Efficient Multilabel Image Classification},
  author = {Kirill Prokofiev and Vladislav Sovrasov},
  journal= {arXiv preprint arXiv:2209.06585},
  year   = {2022}
}

备注

Accepted at VISAPP 2023