中文

莱姆病患者调查数据上的特征选择

计算机与社会 2020-09-22 v1 机器学习 机器学习

摘要

莱姆病是一种迅速增长的疾病,但在医学界仍知之甚少。关于患者何时以及为何对治疗产生反应或持续患病、哪些治疗有效、甚至如何正确诊断该疾病等关键问题,在很大程度上仍未得到解答。我们通过将机器学习技术应用于由非营利组织 LymeDisease.org 开发的大规模莱姆病患者登记库 MyLymeData 来研究这些问题。我们应用多种机器学习方法,以衡量个体特征在预测参与者对全球变化评分(GROC)调查问题作答时的效应,该调查评估其在抗生素治疗后自我报告的健康状况改善、恶化或保持不变的程度。我们使用基础线性回归、支持向量机、神经网络、基于熵的决策树模型以及 kk-近邻方法。我们首先分析模型的总体性能,然后识别出预测参与者 GROC 作答的最重要特征。在识别出“关键”特征后,我们将它们从数据集中分离出来,并展示这些特征在识别 GROC 上的有效性。在此过程中,我们从数学和临床两方面指出了未来研究的可能方向。

关键词

引用

@article{arxiv.2009.09087,
  title  = {Feature Selection on Lyme Disease Patient Survey Data},
  author = {Joshua Vendrow and Jamie Haddock and Deanna Needell and Lorraine Johnson},
  journal= {arXiv preprint arXiv:2009.09087},
  year   = {2020}
}

备注

9 pages, 8 figures, 6 tables