中文

一种用于有监督特征排序算法评估的新方法

机器学习 2022-07-12 v1 人工智能 分布式、并行与集群计算

摘要

在特征选择与可解释人工智能领域中,都存在基于重要性对特征进行“排序”的需求。此类特征重要性排序随后可用于:(1) 缩减数据集规模,或 (2) 解释机器学习模型。然而,文献中此类特征排序器并未以系统、一致的方式接受评估。许多论文以不同方式论证哪种特征重要性排序器效果最佳。本文通过提出一种新的评估方法来填补这一空白。借助合成数据集,特征重要性分数可预先获知,从而实现更系统的评估。为便于使用新方法进行大规模实验,我们用 Python 构建了一个名为 fseval 的基准测试框架。该框架支持在 HPC 系统上跨机器并行与分布式运行实验。通过与名为 Weights and Biases 的在线平台集成,可在实时仪表盘上交互式探索图表。该软件作为开源软件发布,并以包的形式发布于 PyPi 平台。本研究最后通过一个此类大规模实验,从多方面探究参与算法的优势与不足。

关键词

引用

@article{arxiv.2207.04258,
  title  = {A novel evaluation methodology for supervised Feature Ranking algorithms},
  author = {Jeroen G. S. Overschie},
  journal= {arXiv preprint arXiv:2207.04258},
  year   = {2022}
}

备注

56 pages, 29 figures