特征选择在构建两层决策树中的作用与效用
机器学习
2023-01-02 v1 人工智能
摘要
如今,当存在因过拟合导致性能下降的风险或计算资源有限时,特征选择常被用于机器学习中。在特征选择过程中,会选择最相关且冗余最少的特征子集。近年来,人们已清楚认识到,除相关性和冗余性外,还必须考虑特征的互补性。非正式地讲,如果特征单独作为目标变量的预测器时较弱,而组合时作为预测器较强,则它们是互补的。本文证明,在构建两层决策树时,互补特征相互放大的协同效应会受到另一个特征的干扰,从而导致性能下降。通过在合成与真实数据集、回归与分类上使用交叉验证证明,移除或消除该干扰特征可使性能提升多达24倍。还发现,领域学习得越少,性能提升越大。更正式地,证明了在消除干扰特征之前数据集上的性能与消除干扰特征后的性能增长之间存在统计显著的负秩相关。结论是,这拓宽了在数据和计算资源充足情况下特征选择方法的范围。
引用
@article{arxiv.2212.14448,
title = {On the utility of feature selection in building two-tier decision trees},
author = {Sergey A. Saltykov},
journal= {arXiv preprint arXiv:2212.14448},
year = {2023}
}
备注
13 pages, 2 figures, 4 tables