ORSA:用于集成系统最劣与最优逼近的离群鲁棒堆叠聚合方法
机器学习
2021-11-18 v1
摘要
近年来,由于计算能力增强使得在合理时间内训练大型集成成为可能,集成学习在各应用中的使用显著增长。许多应用(例如恶意软件检测、人脸识别或金融决策)使用一组有限的学习算法并将其聚合,以获得优于任一单独学习算法的预测性能。在半导体器件后硅验证(PSV)领域,通常提供的数据集由不同器件(例如不同生产线的芯片)组成。在 PSV 中,任务是通过多个学习算法逼近数据的底层函数,每个算法在器件特定子集上训练,而非提升任意分类器在整个数据集上的性能。此外,预期有未知数量的子集所描述的函数表现出极不同的特征。相应的集成成员被称为离群值,会严重影响逼近效果。我们的方法旨在寻找一种对离群值鲁棒且代表最优或最劣情形的合适逼近,以尽可能适用于多种类型。以“软最大”或“软最小”函数替代最大或最小算子。一个神经网络(NN)通过两阶段过程学习该“软函数”。首先,我们选取代表最优或最劣情形的集成成员子集。其次,我们组合这些成员并定义一种利用局部离群因子(LOF)特性来增大非离群值影响、减小离群值影响的加权方式。该加权确保对离群值的鲁棒性,并使逼近适用于大多数类型。
引用
@article{arxiv.2111.09043,
title = {ORSA: Outlier Robust Stacked Aggregation for Best- and Worst-Case Approximations of Ensemble Systems\},
author = {Peter Domanski and Dirk Pflüger and Jochen Rivoir and Raphaël Latty},
journal= {arXiv preprint arXiv:2111.09043},
year = {2021}
}
备注
Accepted paper for ICMLA 2021 (Special Session "Machine Learning for Predictive Models in Engineering Applications (MLPMEA 2021)")