中文

预算约束下漂移数据流的挖掘:主动学习与自标注的结合

机器学习 2021-12-22 v1

摘要

挖掘数据流带来若干挑战,包括数据的连续与非平稳性质、待处理信息的海量规模以及对计算资源的限制。尽管文献中针对该问题提出了许多监督解决方案,但大多数假设对真值(以类标签形式)的访问是无限的,并且此类信息可在更新学习系统时立即被利用。这远非现实,因为必须考虑获取标签的潜在成本。因此,需要能够在流场景中对真值需求加以削减的解决方案。在本文中,我们提出了一种在预算约束下挖掘漂移数据流的新框架,通过结合来自主动学习和自标注的信息。我们引入了若干策略,可利用智能实例选择和半监督过程,同时考虑概念漂移的潜在存在。这种混合方法允许在现实标注预算内对数据流结构进行高效探索与利用。由于我们的框架作为包装器工作,它可应用于不同的学习算法。在具有各类概念漂移的多样化真实世界数据流上开展的实验研究,证明了所提策略在类标签访问高度受限时的有用性。当无法增加标注预算或更换低效分类器时,该混合方法尤为可行。我们就策略的适用领域给出了一组建议。

关键词

引用

@article{arxiv.2112.11019,
  title  = {Mining Drifting Data Streams on a Budget: Combining Active Learning with Self-Labeling},
  author = {Łukasz Korycki and Bartosz Krawczyk},
  journal= {arXiv preprint arXiv:2112.11019},
  year   = {2021}
}