面向多视图集成学习的语义保持特征划分
机器学习
2024-01-15 v1 信息论
math.IT
摘要
在机器学习中,数据的指数级增长及相关的“维数灾难”带来了重大挑战,尤其是在庞大但稀疏的数据集上。为应对这些挑战,多视图集成学习(MEL)已成为一种变革性方法,其中特征划分(FP)在为MEL构建人工视图方面起着关键作用。我们的研究引入了语义保持特征划分(SPFP)算法,这是一种基于信息论的新颖方法。SPFP算法能有效地将数据集划分为多个语义一致的视图,从而增强MEL过程。通过在八个真实世界数据集上进行广泛实验,这些数据集涵盖从高维少实例到低维多实例的范围,我们的方法展示了显著的有效性。它在可实现高泛化性能的场景下保持模型准确性的同时,显著改善了不确定性度量;反之,在难以获得高泛化准确性的场景下,它在保持不确定性度量的同时提高了准确性。效应量分析进一步揭示,SPFP算法以大的效应量优于基准模型,并通过有效的降维减少了计算需求。在大多数实验中观察到的大效应量凸显了该算法在模型性能上的显著提升。
引用
@article{arxiv.2401.06251,
title = {Semantic-Preserving Feature Partitioning for Multi-View Ensemble Learning},
author = {Mohammad Sadegh Khorshidi and Navid Yazdanjue and Hassan Gharoun and Danial Yazdani and Mohammad Reza Nikoo and Fang Chen and Amir H. Gandomi},
journal= {arXiv preprint arXiv:2401.06251},
year = {2024}
}
备注
45 pages, 44 figures, 26 tables