中文

面向通用模型的无训练数据选择

计算机视觉与模式识别 2023-10-17 v2 机器学习

摘要

一种理想的数据选择算法能够高效地挑选出信息量最大的样本,以最大化有限标注预算的效用。然而,以主动学习方法为代表的现有方法通常遵循繁琐的流程,反复迭代耗时的模型训练与批量数据选择。本文通过设计一种独特的数据选择流程来挑战这一现状,该流程利用现有通用模型以单次推理从各种数据集中选择数据,无需额外训练或监督。基于这一新流程,我们提出了一种新颖的无训练数据选择(FreeSel)方法。具体而言,我们定义了从通用模型中间特征中提取的语义模式,以捕捉每张图像中细微的局部信息。随后,我们通过在细粒度语义模式层面基于距离的采样,在单次推理中完成所有数据样本的选择。FreeSel 绕过了繁重的批量选择过程,实现了效率的显著提升,比现有主动学习方法快 530 倍。大量实验验证了 FreeSel 在各种计算机视觉任务上的有效性。我们的代码可在 https://github.com/yichen928/FreeSel 获取。

关键词

引用

@article{arxiv.2309.17342,
  title  = {Towards Free Data Selection with General-Purpose Models},
  author = {Yichen Xie and Mingyu Ding and Masayoshi Tomizuka and Wei Zhan},
  journal= {arXiv preprint arXiv:2309.17342},
  year   = {2023}
}

备注

accepted by NeurIPS 2023