中文

神经网络集成:理论、训练与显式多样性的重要性

机器学习 2021-09-30 v1

摘要

集成学习是一个策略性地生成多个基学习器并将其组合为一个复合学习器的过程。集成性能有两个 essential 特征:组件学习器的个体准确性和集成的整体多样性。学习器准确性和集成多样性的恰当平衡能够提升机器学习任务在基准数据集和真实世界数据集上的性能,近期理论和实际工作证明了集成中准确性与多样性之间的微妙权衡。在本文中,我们扩展了现有文献,为评估和改进任意给定集成(包括随机森林和深度神经网络集成)的最优性提供了更深刻的理论理解。我们还提出了一种用于神经网络集成的训练算法,并证明与使用标准损失函数训练的 SOTA 个体学习器及 SOTA 学习器集成相比,我们的方法提供了更好的性能。我们的核心洞察是,显式鼓励集成中的多样性比仅仅让多样性偶然发生更好,并且关于多样性与学习器准确性的严格理论界使人们能够知道何时实现了最优配置。

关键词

引用

@article{arxiv.2109.14117,
  title  = {Neural Network Ensembles: Theory, Training, and the Importance of Explicit Diversity},
  author = {Wenjing Li and Randy C. Paffenroth and David Berthiaume},
  journal= {arXiv preprint arXiv:2109.14117},
  year   = {2021}
}