中文

从稀疏标注的概念漂移数据流中学习临时概念的样本利用方法

机器学习 2020-09-22 v1 机器学习

摘要

由于在线工具和系统的日益增多,从流式数据源进行持续学习变得越来越流行。处理动态且永不停歇的问题带来了新的挑战,传统的基于批处理的离线算法在计算时间与预测性能方面显得不足。其中最关键的局限之一是我们不能假设可以访问有限且完整的数据集——我们必须时刻准备应对可能补充我们模型的新数据。这带来了为潜在无限数据流提供标签的关键问题。在现实世界中,我们被迫应对非常严格的预算限制,因此极可能面临标注样本稀缺的困境,而标注样本在有监督学习中至关重要。在我们的工作中,我们强调这一问题并提出了一种新颖的样本利用技术。我们表明:当(i)数据具有临时非平稳概念,且(ii)在很长的时间跨度上仅有极少标签时,实际上更好的做法是承担过拟合风险,通过利用我们仅有的标注样本更激进地适配模型,而不是固守标准学习模式而遭受严重的欠拟合。我们给出了方法的不同策略与配置,以及一种试图在激进适配与正常适配之间保持平衡的集成算法。最后,我们使用与该问题相关的最先进流式算法,对我们的方法进行了复杂的深入比较分析。

关键词

引用

@article{arxiv.2009.09382,
  title  = {Instance exploitation for learning temporary concepts from sparsely labeled drifting data streams},
  author = {Łukasz Korycki and Bartosz Krawczyk},
  journal= {arXiv preprint arXiv:2009.09382},
  year   = {2020}
}

备注

35 pages, 17 figures, 8 tables