概念漂移数据流中元学习器的概念多样基模型选择
机器学习
2021-11-30 v1
摘要
元学习器与集成方法旨在组合一组相关且多样的基模型以提升预测性能。然而,确定合适的基模型集合具有挑战性,尤其在底层数据分布可能随时间变化的在线环境中。本文提出一种估计基模型概念相似性的新方法,该方法利用它们底层子空间之间的主角度(PAs)计算。我们提出两种方法,以概念相似性作为度量来获取相关且多样的基模型子集:(i)参数化阈值剔除与(ii)无参数概念聚类。在在线迁移学习(TL)背景下,我们使用合成与真实世界数据,针对基于常用集成剪枝度量(即预测性能与互信息(MI))的阈值法评估这些方法。结果表明,概念相似性阈值法计算开销更低,且预测性能与基于预测性能和MI的阈值法相当。此外,概念聚类在无需参数化的情况下取得相似预测性能,并且当基模型数量较大时,其计算开销低于基于预测性能和MI的阈值法。
引用
@article{arxiv.2111.14520,
title = {Conceptually Diverse Base Model Selection for Meta-Learners in Concept Drifting Data Streams},
author = {Helen McKay and Nathan Griffiths and Phillip Taylor},
journal= {arXiv preprint arXiv:2111.14520},
year = {2021}
}