中文

在视觉基础模型时代重新审视主动学习

计算机视觉与模式识别 2024-06-26 v2 机器学习

摘要

基础视觉或视觉-语言模型在大规模无标签或噪声数据上训练,学习到鲁棒的表示,能够在多种任务上实现令人印象深刻的零样本或少样本性能。鉴于这些特性,它们天然适用于旨在最大化标注效率的主动学习(AL)。然而,基础模型的全部潜力尚未在主动学习的背景下得到探索,特别是在低预算情况下。在这项工作中,我们评估了基础模型如何影响有效主动学习的三个关键组成部分,即:1)初始标注池选择,2)确保多样性采样,以及 3)代表性采样与不确定性采样之间的权衡。我们系统地研究了基础模型(DINOv2, OpenCLIP)的鲁棒表示如何挑战主动学习中的现有发现。我们的观察结果为构建一种新的简单而优雅的主动学习策略提供了原则性指导,该策略平衡了通过 dropout 估计的不确定性与样本多样性。我们在许多具有挑战性的图像分类基准上广泛测试了我们的策略,包括自然图像以及在主动学习文献中研究相对不足的域外生物医学图像。我们还在 https://github.com/sanketx/AL-foundation-models 提供了现代主动学习策略(包括我们的方法)的高性能且高效的实现。

关键词

引用

@article{arxiv.2401.14555,
  title  = {Revisiting Active Learning in the Era of Vision Foundation Models},
  author = {Sanket Rajan Gupte and Josiah Aklilu and Jeffrey J. Nirschl and Serena Yeung-Levy},
  journal= {arXiv preprint arXiv:2401.14555},
  year   = {2024}
}

备注

Accepted to TMLR