中文

利用分量分类器的线性独立性:优化在线集成的大小与预测精度

机器学习 2023-08-29 v1

摘要

集成方法通过一组分类器协同提升分类精度,在大数据时代至关重要。然而,尽管学界普遍认同集成规模与其预测精度之间存在关联,该关系的确切性质仍属未知。我们引入一种植根于分类器投票线性独立性的新视角,以分析集成规模与预测精度之间的相互作用。该框架揭示了二者间的理论联系,并据此提出基于该关系的集成规模。本研究构建于几何框架之上,发展了一系列定理,阐明了线性依赖性在构建集成中的作用。我们提出一种方法以确定确保分量分类器间投票以目标概率线性独立所需的最小集成规模。结合真实与合成数据集,实证结果表明:正如理论所预测,增加分类器数量可提升精度。然而,我们也识别出收益递减的拐点,超过该点后追加分类器带来的精度改善递减。令人惊讶的是,计算所得理想集成规模在某些数据集上偏离实证结果,凸显了其他因素的影响。本研究为深入探究支配集成设计的复杂动力学开辟途径,并为实际场景中构建高效有效的集成提供指导。

关键词

引用

@article{arxiv.2308.14175,
  title  = {Leveraging Linear Independence of Component Classifiers: Optimizing Size and Prediction Accuracy for Online Ensembles},
  author = {Enes Bektas and Fazli Can},
  journal= {arXiv preprint arXiv:2308.14175},
  year   = {2023}
}