用于孤独症谱系障碍监测的机器学习算法比较
机器学习
2020-07-01 v3 机器学习
摘要
美国疾病控制与预防中心(CDC)协调一项劳动密集型流程,以测算儿童中孤独症谱系障碍(ASD)的患病率。随机森林方法在加速该流程方面已显示出前景,但其分类准确率落后于人工约 5%。我们探究近期可用的文档分类算法能否缩小这一差距。我们应用了 8 种监督学习算法,仅基于评估文本中的词语来预测儿童是否符合 ASD 的病例定义。我们在数据的 10 次随机训练-测试划分下比较了算法表现,使用分类准确率、F1 分数和阳性调用次数来评估其用于监测的潜力。在 10 次训练-测试循环中,随机森林与带朴素贝叶斯特征的支撑向量机(NB-SVM)各自取得了略高于 87% 的平均准确率。NB-SVM 产生的假阴性显著多于假阳性(P = 0.027),而随机森林则不然,使其患病率估计非常接近数据中的真实患病率。表现最佳的神经网络在两项指标上均与随机森林相似。随机森林表现不逊于 NB-SVM 和神经网络等较新模型,且给出了良好的患病率估计。因假阴性增加,NB-SVM 可能不宜用于全自动化监测工作流。由于数据特征,诸如层次卷积神经网络等更复杂算法或因训练不可行。若数据被不同地抽取与处理,且算法除评估外还考虑儿童相关信息,当前算法表现或可更佳。
引用
@article{arxiv.1804.06223,
title = {A Comparison of Machine Learning Algorithms for the Surveillance of Autism Spectrum Disorder},
author = {Scott H Lee and Matthew J Maenner and Charles M Heilig},
journal= {arXiv preprint arXiv:1804.06223},
year = {2020}
}