基于视觉-语言模型适配与开放数据的主动学习
计算机视觉与模式识别
2025-06-03 v1
摘要
视觉-语言模型(VLM)在海量网络开放数据上预训练,在适配到任务特定的标注数据后,为解决下游任务提供了强大的能力。然而,数据标注成本高昂且可能需要领域专业知识。主动学习旨在通过策略性地选择最具信息量的数据进行标注和模型训练来降低这一成本。近期的主动学习方法已探索了 VLM,但尚未利用公开可用的开放数据,例如 VLM 的预训练数据。在本工作中,我们通过检索与任务相关的样本来扩充任务特定样本,从而利用此类数据。正如预期,纳入这些数据显著提升了主动学习效果。鉴于我们的方法利用了开源 VLM 和开放数据,我们将其称为基于开放资源的主动学习(ALOR)。此外,大多数基于 VLM 的主动学习方法使用提示微调(PT)进行模型适配,这可能是由于其能够直接利用预训练参数,且假设这样做可降低在有限标注数据上过拟合的风险。我们严格比较了流行的适配方法,包括线性探测(LP)、微调(FT)和对比微调(CT)。我们揭示了两个关键发现: 所有适配方法均受益于纳入检索数据; CT 在各种主动学习方法中显著优于其他方法。对检索数据的进一步分析揭示了任务相关类别存在自然的不平衡分布,暴露了 VLM 内在的偏差。这促使我们提出了一种新颖的主动学习尾部优先采样(TFS)策略,这是一种极其简单却有效的方法,优先从代表性不足的类别中采样数据进行标注。大量实验表明,我们的最终方法——在检索数据和 TFS 选定的标注数据上对 VLM 进行对比微调——显著优于现有方法。
引用
@article{arxiv.2506.01724,
title = {Active Learning via Vision-Language Model Adaptation with Open Data},
author = {Tong Wang and Jiaqi Wang and Shu Kong},
journal= {arXiv preprint arXiv:2506.01724},
year = {2025}
}
备注
Here is the project webpage: https://leowangtong.github.io/ALOR/