基于弱监督的流式无标签数据概念漂移检测与适应
机器学习
2019-10-03 v1 机器学习
摘要
在学习与分类中,当数据特征或目标的统计特性随时间发生变化时,就会出现概念漂移;在搜索数据、医学研究、恶意软件、网络数据和视频中均已出现漂移证据。由于这些领域带来的独特挑战,在高维、噪声大、低上下文的数据(如流式文本、视频或图像)中,漂移适应尚未得到解决。我们提出一种双重方法来处理这些领域中的概念漂移:一种基于密度的聚类方法来处理虚拟概念漂移(特征统计特性的变化),以及一个弱监督步骤来处理真实概念漂移(目标统计特性的变化)。我们的基于密度的聚类避免了维数灾难带来的问题,从而创建出实时数据空间的演化“地图”,由此解决特征中的虚拟漂移。我们的弱监督步骤利用高置信度标签(oracle 或启发式标签)生成加权训练集,以泛化并更新现有的深度学习者,使其适应变化的决策边界(真实漂移),并为数据空间中未见的区域创建新的深度学习者。我们的结果表明,我们的双重方法表现良好,在2014年初始部署四年后的2018年,无需任何人工干预即可达到>90%的精度。
引用
@article{arxiv.1910.01064,
title = {Concept Drift Detection and Adaptation with Weak Supervision on Streaming Unlabeled Data},
author = {Abhijit Suprem},
journal= {arXiv preprint arXiv:1910.01064},
year = {2019}
}