中文

高维空间中基于边界的采样:主动学习不如被动学习高效的情形

机器学习 2023-06-05 v2

摘要

人们普遍认为,在给定相同标注预算下,主动学习(AL)算法(如基于边界的主动学习)比被动学习(PL)取得更好的预测性能,尽管计算成本更高。最近的实证证据表明,这种额外成本可能徒劳无功,因为基于边界的 AL 有时甚至比 PL 表现更差。虽然现有工作在低维情形下提供了不同解释,本文表明其底层机制在高维中完全不同:我们针对逻辑回归证明,即便在无噪声数据且使用贝叶斯最优决策边界进行采样时,PL 也优于基于边界的 AL。我们证明中的见解表明,当类别间分离较小时,这种高维现象会加剧。我们在涵盖金融、组织学、化学和计算机视觉等多样应用的 20 个高维数据集上通过实验证实了这一直觉。

关键词

引用

@article{arxiv.2212.00772,
  title  = {Margin-based sampling in high dimensions: When being active is less efficient than staying passive},
  author = {Alexandru Tifrea and Jacob Clarysse and Fanny Yang},
  journal= {arXiv preprint arXiv:2212.00772},
  year   = {2023}
}