互补集成学习
机器学习
2021-11-17 v1
摘要
为实现机器学习(ML)任务的高性能,基于深度学习的模型必须隐式地捕捉数据中的完整分布。因此,它需要海量的训练样本,且数据应充分呈现真实分布,尤其对于图像、视频等高维数据。然而在实践中,数据通常以多种风格被收集,其中若干风格的代表样本数量不足。这可能导致模型预测的不确定性,并显著降低ML任务性能。本文通过考察模型不确定性,对这一问题进行了深入研究。由此,我们推导出一种简单而高效的技术,以提升最先进深度学习模型的性能。具体而言,我们训练能够补充最先进模型不确定性的辅助模型。因此,通过集成这些模型,可显著提升前述类型数据的ML任务性能。尽管在基准数据集上ML分类准确率仅略有提升(如MNIST上0.2%),我们所提方法在有限数据上显著提升(即Eardrum上1.3%,ChestXray上3.5%)。
引用
@article{arxiv.2111.08449,
title = {Complementary Ensemble Learning},
author = {Hung Nguyen and Morris Chang},
journal= {arXiv preprint arXiv:2111.08449},
year = {2021}
}