面向演化数据流的重现概念元学习
机器学习
2019-05-23 v1 机器学习
摘要
当在数据流分类中检测到概念漂移时,常见的补救方法是重新训练框架的分类器。然而,若分类器已较好学习当前概念且此概念未来会重现,则会丢失有用信息。一些框架保留并重用分类器,但选择合适的重用分类器可能耗时。这些框架很少能匹配最先进集成方法的精度。对许多数据流任务而言,速度很重要:时间依赖应用需要快速、准确的框架。我们提出增强概念剖析框架(ECPF),旨在识别重现概念并重用先前训练的分类器,从而在漂移后立刻实现准确分类。ECPF 的新颖之处在于利用新分类器与现有分类器对新数据的分类相似性,快速识别最佳重用分类器。它始终同时训练新分类器和重用分类器,并在概念漂移发生时保留更准确的分类器。最后,它创建重用分类器的副本,使适合重现概念的分类器不会因在不同概念上训练而受影响。在我们的实验中,在含重现概念的合成数据集上,ECPF 比最先进的分类器重用框架(Diversity Pool)和最先进的集成技术(Adaptive Random Forest)分类显著更准确。它对真实世界数据集的分类比 Diversity Pool 快五倍,比 Adaptive Random Forest 快六倍,且精度与两者相比无显著差异。
引用
@article{arxiv.1905.08848,
title = {Recurring Concept Meta-learning for Evolving Data Streams},
author = {Robert Anderson and Yun Sing Koh and Gillian Dobbie and Albert Bifet},
journal= {arXiv preprint arXiv:1905.08848},
year = {2019}
}