中文

GCI-ViTAL:基于视觉Transformer的渐进置信提升用于标签噪声下的主动学习

计算机视觉与模式识别 2024-11-12 v1 人工智能 机器学习

摘要

主动学习旨在通过策略性地选择信息量大的样本进行标注,在最小化标注成本的同时训练准确的分类器。本研究聚焦于图像分类任务,在不同标签噪声率下,在 CIFAR10、CIFAR100、Food101 和胸部 X 光数据集上比较了主动学习方法。我们通过比较卷积神经网络(CNN)和视觉 Transformer(ViT)模型来研究模型架构的影响。此外,我们提出了一种新型深度主动学习算法 GCI-ViTAL,旨在对标签噪声具有鲁棒性。GCI-ViTAL 利用预测熵以及最后一层注意力向量的 Frobenius 范数与类中心干净集注意力向量的比较来工作。我们的方法识别出既不确定又与其分配类别中的典型图像在语义上分歧的样本。这使得 GCI-ViTAL 即使在存在标签噪声的情况下也能选择信息量大的数据点,同时标记出潜在的误标候选样本。标签平滑被应用于训练一个对潜在噪声标签不过度自信的模型。我们在不同的对称标签噪声水平下评估了 GCI-ViTAL,并将其与五种其他主动学习策略进行了比较。我们的结果表明,在所有主动学习策略中,使用 ViT 相比 CNN 带来了显著的性能提升,尤其是在噪声标签设置下。我们还发现,利用图像的语义信息作为标签锚点有助于在标签噪声下训练更鲁棒的模型。值得注意的是,我们未进行大量的超参数调优,提供了一种开箱即用的比较,解决了从业者在不进行详尽文献综述的情况下为真实应用数据选择和训练视觉模型及主动学习策略时面临的常见挑战。

关键词

引用

@article{arxiv.2411.05939,
  title  = {GCI-ViTAL: Gradual Confidence Improvement with Vision Transformers for Active Learning on Label Noise},
  author = {Moseli Mots'oehli and kyungim Baek},
  journal= {arXiv preprint arXiv:2411.05939},
  year   = {2024}
}

备注

under review