中文

IncA-DES:基于在线K-d树邻域搜索的增量自适应动态集成选择方法

机器学习 2025-07-18 v1

摘要

数据流带来了批处理机器学习通常不遇到的挑战,其中之一是概念漂移,即数据分布随时间变化的表现。在文献中探索了许多方法,其中融合分类器的做法正在受到关注。由于基于实例的集成方法在漂移情景下似乎很高效,但必须注意将此类方法适用于概念漂移。训练必须创建局部专家,而常用的邻域搜索集成选择方法在数据持续到达的情况下可能变得昂贵。本文提出了IncA-DES,该方法采用促进局部专家生成的训练策略,假设特征空间的不同区域会随时间可用。此外,融合概念漂移检测器支持信息维护和对新概念的适应。还采用基于重叠的分类过滤器,以避免在邻域内存在共识时使用集成选择方法,我们认为每种集成选择方法都应采用此策略,因为它已被证明使方法更具可应用性和更快。此外,旨在减少KNN的处理时间,我们提出了一种在线K-d树算法,该算法能够快速删除实例且不会产生不一致,同时处理数据流中可能出现的不平衡问题。实验结果表明,所提出的框架在不同标签可用性水平下比七种最先进方法获得更好的平均准确率,同时在最准确的方法中实现了更小的处理时间。此外,与在线K-d树的融合在准确率几乎不变的情况下提高了处理时间。我们已将该框架在线发布于仓库中。

关键词

引用

@article{arxiv.2507.12573,
  title  = {IncA-DES: An incremental and adaptive dynamic ensemble selection approach using online K-d tree neighborhood search for data streams with concept drift},
  author = {Eduardo V. L. Barboza and Paulo R. Lisboa de Almeida and Alceu de Souza Britto and Robert Sabourin and Rafael M. O. Cruz},
  journal= {arXiv preprint arXiv:2507.12573},
  year   = {2025}
}

备注

Preprint of article published to Information Fusion