中文

教育数据挖掘中特征选择技术的研究

数据库 2009-12-22 v1

摘要

教育数据挖掘(EDM)是一个新兴的研究领域,数据挖掘概念的本质被应用于教育领域,旨在提取学习过程中学生行为的有用信息。在EDM中,需要进行特征选择以生成候选变量的子集。由于特征选择影响任何性能模型的预测准确性,因此有必要详细研究学生表现模型与特征选择技术相关的有效性。为此,本研究不仅致力于通过采用数据挖掘中的各种过滤式特征选择技术,以最小基数找出最相关的子集特征,从而实现高预测性能,而且还评估了不同基数子集的优劣,以及六种过滤式特征选择算法在F-measure值和接收者操作特征(ROC)值方面的质量,这些值由作为基线分类器方法的NaiveBayes算法生成。我们对六种过滤式特征选择算法进行的比较研究揭示了最佳方法以及特征子集的最优维度。随后,通过部署不同的分类器模型对过滤式特征选择方法进行了基准测试。本研究的结果有效支持了众所周知的结论,即预测准确性随着特征数量的最小化而提高。预期结果表明,在学生表现模型的训练和分类阶段,计算时间和构建成本均有所降低。

关键词

引用

@article{arxiv.0912.3924,
  title  = {A Study on Feature Selection Techniques in Educational Data Mining},
  author = {M. Ramaswami and R. Bhaskaran},
  journal= {arXiv preprint arXiv:0912.3924},
  year   = {2009}
}