面向通用模型的无训练数据选择
计算机视觉与模式识别
2023-10-17 v2 机器学习
摘要
一种理想的数据选择算法能够高效地挑选出信息量最大的样本,以最大化有限标注预算的效用。然而,以主动学习方法为代表的现有方法通常遵循繁琐的流程,反复迭代耗时的模型训练与批量数据选择。本文通过设计一种独特的数据选择流程来挑战这一现状,该流程利用现有通用模型以单次推理从各种数据集中选择数据,无需额外训练或监督。基于这一新流程,我们提出了一种新颖的无训练数据选择(FreeSel)方法。具体而言,我们定义了从通用模型中间特征中提取的语义模式,以捕捉每张图像中细微的局部信息。随后,我们通过在细粒度语义模式层面基于距离的采样,在单次推理中完成所有数据样本的选择。FreeSel 绕过了繁重的批量选择过程,实现了效率的显著提升,比现有主动学习方法快 530 倍。大量实验验证了 FreeSel 在各种计算机视觉任务上的有效性。我们的代码可在 https://github.com/yichen928/FreeSel 获取。
引用
@article{arxiv.2309.17342,
title = {Towards Free Data Selection with General-Purpose Models},
author = {Yichen Xie and Mingyu Ding and Masayoshi Tomizuka and Wei Zhan},
journal= {arXiv preprint arXiv:2309.17342},
year = {2023}
}
备注
accepted by NeurIPS 2023