中文

关于从流式无标签数据中可靠检测概念漂移

机器学习 2017-04-04 v1 人工智能 机器学习

摘要

部署在真实世界中的分类器运行于动态环境中,其数据分布会随时间变化。这些变化被称为概念漂移,会导致分类器的预测性能随时间下降,从而使其失效。为了具备实际用途,这些分类器需要能够检测漂移并随时间对其进行适应。检测漂移传统上被视为一项监督任务,不断使用带标签数据来验证学习到的模型。尽管在检测漂移方面行之有效,但这些技术并不实用,因为标注是一项困难、昂贵且耗时的活动。另一方面,无监督变化检测技术并不可靠,因为它们会产生大量误报。无监督技术的低效源于在检测过程中排除了所学分类器的特性。在本文中,我们提出了边界密度漂移检测(MD3)算法,该算法跟踪分类器不确定区域中的样本数量,以此作为检测漂移的指标。MD3算法是一种独立于分布、独立于应用、独立于模型的无监督增量算法,能够可靠地从数据流中检测漂移。在6个诱发漂移的数据集和4个来自网络安全领域的额外数据集上的实验评估表明,与基于无监督特征的漂移检测器相比,MD3方法能够可靠地检测漂移,且误报率显著降低。降低的误报率使得仅在漂移最有可能影响分类性能时才发出漂移信号。因此,MD3方法带来了一种可信、标签高效且适用性广泛的检测方案。

关键词

引用

@article{arxiv.1704.00023,
  title  = {On the Reliable Detection of Concept Drift from Streaming Unlabeled Data},
  author = {Tegjyot Singh Sethi and Mehmed Kantardzic},
  journal= {arXiv preprint arXiv:1704.00023},
  year   = {2017}
}