MH-FSF:克服特征选择评估基准测试与可重复性限制的统一框架
机器学习
2025-07-16 v1 人工智能
密码学与安全
性能
摘要
特征选择对于构建有效的预测模型至关重要,因为它减少了维度并强调关键特征。然而,当前研究往往受限于有限的基准测试和依赖专有数据集,这严重阻碍了可重复性并可能对整体性能产生负面影响。为此,我们引入了MH-FSF框架,一个全面、模块化和可扩展的平台,旨在促进特征选择方法的复现和实现。通过合作研究开发,MH-FSF提供了17种方法(11种经典方法,6种领域特定方法)的实现,并可在10个公开可用的Android恶意软件数据集上进行系统评估。我们的结果揭示了在平衡和不平衡数据集之间的性能差异,突显了对于考虑这些不对称性的数据预处理和选择标准的重要性。我们展示了对于比较多样化特征选择技术而言,采用统一平台的重要性,促进了方法论的一致性和严谨性。通过提供这个框架,我们旨在显著拓宽现有文献的范围,为特征选择,特别是Android恶意软件检测领域的新研究方向铺平道路。
关键词
引用
@article{arxiv.2507.10591,
title = {MH-FSF: A Unified Framework for Overcoming Benchmarking and Reproducibility Limitations in Feature Selection Evaluation},
author = {Vanderson Rocha and Diego Kreutz and Gabriel Canto and Hendrio Bragança and Eduardo Feitosa},
journal= {arXiv preprint arXiv:2507.10591},
year = {2025}
}
备注
11 pages; 4 figures; 5 tables; submitted to JBCS