中文

隐式到显式熵正则化:在带噪标签下评估ViT微调

计算机视觉与模式识别 2024-10-08 v1 人工智能

摘要

自动标注大规模数据集会引入具有噪声的训练数据标签,这会严重影响深度神经网络(DNNs)的学习过程。因此,带噪标签学习(NLL)已成为卷积神经网络(CNNs)的关键研究领域,尽管在视觉转换器(ViTs)方面仍鲜有探索。本研究评估了ViT微调对噪声标签的脆弱性,并将其鲁棒性与CNNs进行比较。我们还检验了为CNNs开发的NLL方法是否同样有效用于ViTs。通过线性探针和MLP-K微调,我们使用三个常用分类损失函数:交叉熵(CE)、焦点损失(FL)和平均绝对误差(MAE),以及六种稳健NLL方法:GCE、SCE、NLNL、APL、NCE+AGCE和ANL-CE,对两个ViT主干网络(ViT-B/16和ViT-L/16)进行基准测试。评估覆盖包括MNIST、CIFAR-10/100、WebVision、Clothing1M和Food-101N等六个数据集。此外,我们探讨了隐式预测熵最小化是否为ViT抗噪标签提供鲁棒性,观察到大多数NLL方法中预测熵均呈现整体减少趋势。基于此观察,我们检验了显式熵最小化是否能增强ViT对噪声标签的韧性。我们的发现表明,融入熵正则化可提升既定损失函数(如CE和FL)以及所研究的六种NLL方法在两个ViT主干网络上的性能。

关键词

引用

@article{arxiv.2410.04256,
  title  = {Implicit to Explicit Entropy Regularization: Benchmarking ViT Fine-tuning under Noisy Labels},
  author = {Maria Marrium and Arif Mahmood and Mohammed Bennamoun},
  journal= {arXiv preprint arXiv:2410.04256},
  year   = {2024}
}