从分类器投票的线性无关性视角考察集成学习的性能
机器学习
2025-11-27 v1
摘要
集成学习通过组合多个基分类器来提高分类性能。虽然增加分类器数量通常会提高准确率,但过大的集成会导致计算效率下降和收益递减。本文从分类器投票之间的线性无关性角度,探讨了集成规模与性能之间的关系。我们提出,由线性无关分类器组成的集成在几何模型下能最大化表示容量。随后,我们将线性无关性的重要性推广到加权多数投票问题中。通过建模实现分类器输出线性无关的概率,我们推导出解释集成规模与准确率之间权衡的理论框架。我们的分析得出了实现特定线性无关概率所需集成规模的理论估计。我们通过在真实数据集和合成数据集上的实验验证了理论,其中使用两种集成方法:OzaBagging 和 GOOWE。我们的结果确认,这一理论估计有效地识别了鲁棒集成如 OzaBagging 性能饱和点。相反,对于像 GOOWE 这样的复杂加权方案,我们的框架揭示了高理论多样性可能引发算法不稳定。我们的实现已公开,旨在支持可重复性和后续研究。
引用
@article{arxiv.2511.21465,
title = {Ensemble Performance Through the Lens of Linear Independence of Classifier Votes in Data Streams},
author = {Enes Bektas and Fazli Can},
journal= {arXiv preprint arXiv:2511.21465},
year = {2025}
}
备注
14 pages, 3 figures, 5 tables