中文

宫颈癌数据集的分类

计算机与社会 2019-08-22 v1 机器学习 定量方法 机器学习

摘要

宫颈癌是全球领先的女性生殖系统恶性肿瘤。本文提出了多种分类技术,并展示了特征选择方法在最佳预测宫颈癌疾病中的优势。该数据集包含32个属性和858个样本。此外,该数据存在缺失值和数据不平衡问题。因此,使用了过采样、欠采样以及嵌入式过欠采样方法。此外,为了提高分类器的准确率,还需要降维技术。因此,本文研究了特征选择方法,并将其分为两个不同的类别:过滤法和包装法。结果表明,年龄、首次性行为、怀孕次数、吸烟、激素避孕药以及性传播疾病:生殖器疱疹是主要的预测特征,准确率高达97.5%。决策树分类器在处理分类任务时表现出优越的性能。

关键词

引用

@article{arxiv.1812.10383,
  title  = {Classification of Cervical Cancer Dataset},
  author = {Avishek Choudhury and Y. M. S Al Wesabi and Daehan Won},
  journal= {arXiv preprint arXiv:1812.10383},
  year   = {2019}
}