在具有相似特征的数据集上采用调整稳定性度量的多准则模型拟合
机器学习
2022-03-23 v1 机器学习
摘要
在具有相似(例如高度相关)特征的数据集上,拟合具有高预测精度且包含所有相关特征而不含不相关或冗余特征的模型是一项挑战性任务。我们提出以多准则方式针对预测精度与特征选择稳定性调整预测模型超参数的方法。我们基于模拟与真实数据集评估该方法,并将其与超参数单准则调整的标准方法以及前沿技术“稳定性选择”进行比较。我们得出结论:与两种已有方法相比,我们的方法取得相同或更好的预测性能。在调参时考虑稳定性并不会降低所得模型的预测精度。我们的方法成功选出相关特征并避免不相关或冗余特征。单准则方法未能避免不相关或冗余特征,而稳定性选择方法未能选出足够多的相关特征以达成可接受的预测精度。对于我们的方法,在具有许多相似特征的数据集上,特征选择稳定性必须用调整稳定性度量来评估,即一种考虑特征间相似性的度量。对于仅有少量相似特征的数据集,未调整稳定性度量已足够且计算更快。
引用
@article{arxiv.2106.08105,
title = {Employing an Adjusted Stability Measure for Multi-Criteria Model Fitting on Data Sets with Similar Features},
author = {Andrea Bommert and Jörg Rahnenführer and Michel Lang},
journal= {arXiv preprint arXiv:2106.08105},
year = {2022}
}