中文

ML-Decoder:可扩展且通用的分类头

计算机视觉与模式识别 2022-01-03 v2 机器学习

摘要

本文提出了一种新的基于注意力的分类头 ML-Decoder。ML-Decoder 通过查询预测类别标签的存在,与全局平均池化相比,能更好地利用空间数据。通过重新设计解码器架构并使用新颖的分组解码方案,ML-Decoder 效率极高,并可良好扩展至数千个类别。与使用更大的骨干网络相比,ML-Decoder 始终能提供更优的速度-精度权衡。ML-Decoder 还具有通用性——可作为各种分类头的直接替代,并在使用词查询操作时可泛化至未见过的类别。新颖的查询增强进一步提升了其泛化能力。使用 ML-Decoder,我们在多项分类任务上取得了最先进的结果:在 MS-COCO 多标签分类上,mAP 达到 91.4%;在 NUS-WIDE 零样本分类上,ZSL mAP 达到 31.1%;在 ImageNet 单标签分类上,使用普通的 ResNet50 骨干网络,无需额外数据或蒸馏,即取得了 80.7% 的新最高分。公开代码见:https://github.com/Alibaba-MIIL/ML_Decoder

关键词

引用

@article{arxiv.2111.12933,
  title  = {ML-Decoder: Scalable and Versatile Classification Head},
  author = {Tal Ridnik and Gilad Sharir and Avi Ben-Cohen and Emanuel Ben-Baruch and Asaf Noy},
  journal= {arXiv preprint arXiv:2111.12933},
  year   = {2022}
}