分类中含缺失数据的多目标特征选择
人工智能
2021-04-21 v1
摘要
特征选择(FS)是机器学习中的一个重要研究课题。通常,FS 被建模为一个双目标优化问题,其目标为:1)分类精度;2)特征数量。现实应用中的一个主要问题是缺失数据。含缺失数据的数据库可能不可靠。因此,在缺失部分数据的数据集上进行的 FS 也不可靠。为了直接控制这一困扰该领域的问题,我们在本研究中提出一种新颖的 FS 建模:将可靠性作为问题的第三目标。为解决修改后的问题,我们提出应用非支配排序遗传算法-III(NSGA-III)。我们从加州大学欧文分校(UCI)机器学习仓库选取了六个不完全数据集。我们使用均值插补法处理缺失数据。在实验中,k-近邻(K-NN)被用作分类器以评估特征子集。实验结果表明,所提出的三目标模型结合 NSGA-III 能有效解决本研究包含的六个数据集的 FS 问题。
引用
@article{arxiv.2104.08747,
title = {Multi-objective Feature Selection with Missing Data in Classification},
author = {Yu Xue and Yihang Tang and Xin Xu and Jiayu Liang and Ferrante Neri},
journal= {arXiv preprint arXiv:2104.08747},
year = {2021}
}
备注
1