中文

LLpowershap:基于逻辑损失的自动 Shapley 值特征选择方法

机器学习 2024-11-22 v1

摘要

Shapley 值在机器学习中得到了广泛应用,不仅用于解释黑箱机器学习模型,还用于执行模型调试、敏感性和公平性分析,以及为稳健建模和后续分析选择重要特征。当使用复杂机器学习模型时,Shapley 值在考虑了非线性关系和交互作用后,满足某些公理,这些公理促进了特征对预测或减少误差贡献分配的公平性。最近,已经引入了许多利用 Shapley 值的特征选择方法。在此,我们提出了一种新颖的特征选择方法 LLpowershap,它利用基于损失的 Shapley 值来识别所选特征集中信息量高且噪声最小的特征。我们的模拟结果表明,与其他最先进的特征选择方法相比,LLpowershap 不仅识别出更多信息特征,而且输出的噪声特征更少。在四个真实世界数据集上的基准测试结果表明,与其他基于 Shapley 的包装器方法或过滤方法相比,LLpowershap 的预测性能更高或相当。

关键词

引用

@article{arxiv.2401.12683,
  title  = {LLpowershap: Logistic Loss-based Automated Shapley Values Feature Selection Method},
  author = {Iqbal Madakkatel and Elina Hyppönen},
  journal= {arXiv preprint arXiv:2401.12683},
  year   = {2024}
}