中文

集成学习中多样性的统一理论

机器学习 2024-02-08 v3 人工智能 机器学习

摘要

我们提出一种集成多样性理论,阐释了广泛监督学习场景中多样性的本质。这一挑战被称为集成学习的圣杯,是逾30年来开放的研究问题。我们的框架揭示,多样性事实上是集成损失偏差-方差分解中的一个隐藏维度。我们证明了一系列精确的偏差-方差-多样性分解,适用于回归与分类中广泛的损失,例如平方损失、交叉熵损失与泊松损失。对于不可获得加性偏差-方差分解的损失(例如0/1损失),我们给出一种替代方法:量化多样性的影响,其结果依赖于标签分布。总体而言,我们认为多样性是一种模型拟合的度量,恰如偏差与方差的意义,但计入了集成成员间的统计依赖关系。因此,我们不应像众多工作那样最大化多样性——相反,我们需要权衡偏差/方差/多样性。

关键词

引用

@article{arxiv.2301.03962,
  title  = {A Unified Theory of Diversity in Ensemble Learning},
  author = {Danny Wood and Tingting Mu and Andrew Webb and Henry Reeve and Mikel Luján and Gavin Brown},
  journal= {arXiv preprint arXiv:2301.03962},
  year   = {2024}
}