中文

基于池的批量主动学习中的快速收敛速率

机器学习 2022-06-14 v2 机器学习

摘要

我们考虑一种批量主动学习场景,其中学习器自适应地向标注者发出批量数据点。由于与标注者(通常为人类)的交互轮数更少,批量采样标签在实践中非常可取。然而,批量主动学习通常付出适应性降低的代价,导致次优结果。本文提出一种解决方案,需在所查询点的信息量与多样性之间仔细权衡。我们在实践相关的未标注数据池预先可得(基于池的主动学习)场景下从理论上研究批量主动学习。我们分析了一种新颖的分阶段贪心算法,并表明该算法的超额风险作为标注复杂度的函数,与标准统计学习设定中已知的最小最大速率相匹配。我们的结果还表现出对批量大小的轻微依赖。这些是首项利用信息量与多样性间的仔细权衡来严格量化基于池场景下批量主动学习统计性能的理论结果。

关键词

引用

@article{arxiv.2202.05448,
  title  = {Fast Rates in Pool-Based Batch Active Learning},
  author = {Claudio Gentile and Zhilei Wang and Tong Zhang},
  journal= {arXiv preprint arXiv:2202.05448},
  year   = {2022}
}

备注

This is an extended version of arXiv:2202.05448v1, which has title "Achieving Minimax Rates in Pool-Based Batch Active Learning" and was accepted by ICML 2022 https://icml.cc/virtual/2022/poster/16505