清洗数据池:深度主动学习中未标记数据池的渐进过滤
机器学习
2026-03-27 v2
摘要
现有的主动学习(AL)策略捕获了 fundamentally different 的数据价值观念,例如不确定性或代表性。因此,策略的有效性可能在数据集、模型甚至 AL 循环之间发生显著变化。坚持使用单一策略风险导致次优性能,因为没有单一策略在整个 AL 过程中都占据主导地位。我们引入 REFINE,一种集成 AL 方法,通过组合多个策略(而无需事先知道哪一个策略将表现最佳)来实现集成。在每个 AL 循环中,REFINE 分为两个阶段:(1)渐进过滤通过考虑集成的 AL 策略来迭代细化未标记数据池,保留捕获不同价值观念的有前景的候选对象。(2)基于覆盖性的选择然后从该精炼池中选择最终的 batch,确保所有先前识别的价值观念都得到考虑。跨 6 个分类数据集和 3 个基础模型的大量实验表明,REFINE 持续地优于单个策略和现有的集成方法。值得注意的是,渐进过滤作为一种强大的预处理步骤,可提高任何应用于该精炼池的单个 AL 策略的性能,我们在一个音频频谱分类用例中演示了这一点。最后,REFINE 的集成可以轻松地与即将推出的最新 AL 策略集成。
引用
@article{arxiv.2511.22344,
title = {Cleaning the Pool: Progressive Filtering of Unlabeled Pools in Deep Active Learning},
author = {Denis Huseljic and Marek Herde and Lukas Rauch and Paul Hahn and Bernhard Sick},
journal= {arXiv preprint arXiv:2511.22344},
year = {2026}
}
备注
Accepted at CVPR 2026