中文

图像分类中多域主动学习的基准评测

机器学习 2023-12-04 v1 计算机视觉与模式识别

摘要

主动学习(active learning)旨在通过策略性地标注信息量大的数据点来提升模型性能。尽管已被广泛研究,其在大规模真实世界数据集上的有效性仍未被充分探索。现有研究主要关注单源数据,忽略了真实世界数据的多域特性。我们引入了一个多域主动学习基准以弥补这一差距。我们的基准表明,传统的单域主动学习策略在多域场景下往往不如随机选取有效。我们还引入了 CLIP-GeoYFCC,一个围绕地理域构建的新型大规模图像数据集,与现有的基于类型的域数据集形成对比。在我们的基准上的分析显示,所有多域策略都表现出显著的权衡,没有任何策略能在所有数据集或所有指标上均表现最优,这强调了未来研究的必要性。

关键词

引用

@article{arxiv.2312.00364,
  title  = {Benchmarking Multi-Domain Active Learning on Image Classification},
  author = {Jiayi Li and Rohan Taori and Tatsunori B. Hashimoto},
  journal= {arXiv preprint arXiv:2312.00364},
  year   = {2023}
}