在标签噪声下基于 Vision Transformer 的主动学习中平衡准确性、校准与效率
计算机视觉与模式识别
2025-05-08 v1 人工智能
机器学习
摘要
在 ImageNet 上对预训练卷积神经网络进行微调以用于下游任务已十分成熟。然而,模型规模对 Vision Transformer 在类似场景下(尤其是在标签噪声下)性能的影响在很大程度上仍未被探索。鉴于 Transformer 架构的实用性与多功能性,本研究探讨了其在低预算约束和噪声标签下的实用性。我们在主动学习设置中探讨了分类准确性和校准如何受对称标签噪声影响,并在不同标签噪声率下,于 CIFAR10 和 CIFAR100 数据集上评估了四种 Vision Transformer 配置(Base 和 Large,patch 大小为 16x16 和 32x32)以及三种 Swin Transformer 配置(Tiny、Small 和 Base)。我们的研究结果表明,较大的 ViT 模型(特别是 ViTl32)在准确性和校准方面始终优于较小的同类模型,即使在中等至高标签噪声下也是如此;而 Swin Transformer 在所有噪声水平下均表现出较弱的鲁棒性。我们发现,较小的 patch 大小并不总能带来更好的性能,ViTl16 的表现始终差于 ViTl32,同时却产生了更高的计算成本。我们还发现,基于信息的主动学习策略仅在中等标签噪声率下提供有意义的准确性提升,但与在随机获取的标签上训练的模型相比,它们会导致校准更差,尤其是在高标签噪声率下。我们希望这些见解能为希望在资源受限环境中部署 Vision Transformer 的从业者提供可操作的指导,在这些环境中,平衡模型复杂度、标签噪声和计算效率在模型微调或蒸馏中至关重要。
引用
@article{arxiv.2505.04375,
title = {Balancing Accuracy, Calibration, and Efficiency in Active Learning with Vision Transformers Under Label Noise},
author = {Moseli Mots'oehli and Hope Mogale and Kyungim Baek},
journal= {arXiv preprint arXiv:2505.04375},
year = {2025}
}