中文

一个重新发现并确认不确定性采样在表格数据主动学习中优势的扩展基准

机器学习 2025-06-24 v3

摘要

主动学习(AL)解决了使机器通过策略性查询高效收集标注样本这一关键挑战。在众多 AL 策略中,不确定性采样(US)是最广泛采用的策略之一。US 查询当前模型认为不确定的样本,被证明既简单又有效。尽管文献中有声称存在优于 US 的替代方案,但学界广泛接受仍难以达成。事实上,现有的表格数据集基准就 US 是否持续具有竞争力给出了相互矛盾的结论。在本研究中,我们回顾了过去十年关于 AL 策略的文献,并构建了迄今为止最全面的开源 AL 基准,以理解不同 AL 策略的相对优劣。该基准通过涵盖更广泛的策略、模型和数据覆盖超越了现有基准。通过对现有表格 AL 基准中矛盾结论在宽泛 AL 实验设定下的评估调查,我们揭示了对常被忽视的在使用机器学习模型——US 语境下的**模型兼容性**问题的新见解。具体而言,我们注意到为查询未标注样本和的学习任务采用不同模型会削弱 US 的有效性。值得注意的是,我们的发现确认当与兼容模型配对时,US 相对于其他策略保持竞争优势。这些发现具有实际意义,并为 AL 实践者提供了具体指南,使其能在标注数据有限的表格分类中做出明智决策。本项目的代码可在 https://github.com/ariapoy/active-learning-benchmark 获取。

关键词

引用

@article{arxiv.2306.08954,
  title  = {An Expanded Benchmark that Rediscovers and Affirms the Edge of Uncertainty Sampling for Active Learning in Tabular Datasets},
  author = {Po-Yi Lu and Yi-Jie Cheng and Chun-Liang Li and Hsuan-Tien Lin},
  journal= {arXiv preprint arXiv:2306.08954},
  year   = {2025}
}