中文

利用 Vision Transformer 重新思考长尾识别

计算机视觉与模式识别 2023-04-18 v2

摘要

在现实世界中,数据往往在类别或属性上遵循长尾分布,这催生了具有挑战性的长尾识别(LTR)问题。在本文中,我们用前景广阔的 Vision Transformer(ViT)重新审视了最近的 LTR 方法。我们发现:1)ViT 在长尾数据上难以训练。2)ViT 以无监督方式(如掩码生成式训练)在长尾或平衡数据集上学习泛化特征。因此,我们建议采用无监督学习来利用长尾数据。此外,我们提出了预测分布校准(PDC)作为 LTR 的新指标,其中模型倾向于简单地将输入分类为常见类别。我们的 PDC 能够定量测量预测偏好的模型校准。在此基础上,我们发现尽管准确率有所提高,许多 LTR 方法仅略微缓解了这一问题。在基准数据集上的大量实验验证了 PDC 准确反映了模型的预测偏好,这与可视化结果一致。

关键词

引用

@article{arxiv.2302.14284,
  title  = {Rethink Long-tailed Recognition with Vision Transformers},
  author = {Zhengzhuo Xu and Shuo Yang and Xingjun Wang and Chun Yuan},
  journal= {arXiv preprint arXiv:2302.14284},
  year   = {2023}
}

备注

Accepted by ICASSP 2023