中文

用视觉Transformer学习不平衡数据

计算机视觉与模式识别 2023-03-09 v2 机器学习

摘要

现实世界的数据往往高度不平衡,严重误导数据驱动的深层神经网络,这使得长尾识别(LTR)成为一项极具挑战性的任务。现有的LTR方法很少使用长尾(LT)数据训练视觉Transformer(ViTs),而ViTs现成的预训练权重总会导致不公平的比较。本文中,我们系统地研究了ViTs在LTR中的表现,并提出LiVT仅使用LT数据从零开始训练ViTs。观察到ViTs遭受更严重的LTR问题,我们进行了掩码生成式预训练(MGP)以学习泛化特征。通过充分且扎实的证据,我们表明MGP比监督式方法更鲁棒。此外,在ViTs上表现突出的二元交叉熵(BCE)损失在LTR中遭遇困境。我们进一步提出平衡BCE,在坚实的理论基础上对其加以改进。具体而言,我们推导了Sigmoid的无偏扩展,并补偿额外的logit边界以部署它。我们的Bal-BCE有助于ViTs在仅仅几个周期内快速收敛。大量实验表明,借助MGP和Bal-BCE,LiVT无需任何额外数据即可成功训练好ViTs,并显著优于可比的最先进方法,例如,我们的ViT-B在iNaturalist 2018上无需额外技巧即达到81.0%的Top-1准确率。代码见https://github.com/XuZhengzhuo/LiVT。

关键词

引用

@article{arxiv.2212.02015,
  title  = {Learning Imbalanced Data with Vision Transformers},
  author = {Zhengzhuo Xu and Ruikang Liu and Shuo Yang and Zenghao Chai and Chun Yuan},
  journal= {arXiv preprint arXiv:2212.02015},
  year   = {2023}
}

备注

Accepted to CVPR 2023, camera-ready version; Code: https://github.com/XuZhengzhuo/LiVT