VLMine:基于视觉语言模型的长尾数据挖掘
计算机视觉与模式识别
2024-09-25 v1 人工智能
摘要
确保在许多实际应用中对长尾样本具有稳健性能是机器学习的一个重要问题,例如自动驾驶。本工作聚焦于识别未标记数据语料库中稀有样本的问题。我们提出一种简单且可扩展的数据挖掘方法,利用视觉语言模型 (VLM) 中所包含的知识。我们的方法利用 VLM 将图像内容概括为一组关键词,并基于关键词频率识别稀有样本。我们发现,与基于模型不确定性的常规方法相比,VLM 为识别长尾样本提供了独特的信号。因此,我们提出一种简单且通用的将来自多个挖掘算法的信号集成的方法。我们在两个多样化的任务上评估了所提出的方法:2D 图像分类,其中类间变异是数据多样性的主要来源;以及 3D 对象检测,其中类内变异是主要关注点。此外,通过检测任务,我们展示了从 2D 图像中提取的知识可转移到 3D 域。我们的实验在多个代表性基准测试上 consistently 显示出在 ImageNet-LT、Places-LT 和 Waymo Open Dataset 上的显著改进(介于 10% 和 50% 之间)。
引用
@article{arxiv.2409.15486,
title = {VLMine: Long-Tail Data Mining with Vision Language Models},
author = {Mao Ye and Gregory P. Meyer and Zaiwei Zhang and Dennis Park and Siva Karthik Mustikovela and Yuning Chai and Eric M Wolff},
journal= {arXiv preprint arXiv:2409.15486},
year = {2024}
}