监督拉普拉斯特征映射及其在儿科心脏病学临床诊断中的应用
机器学习
2012-07-31 v1
摘要
电子健康记录包含丰富的文本数据,这些数据对于基于机器学习的诊断辅助具有关键的预测信息。然而,许多传统机器学习方法无法同时整合向量空间数据和文本。我们提出了一种使用拉普拉斯特征映射的监督方法,通过保留局部相似性的文本预测变量的低维表示来增强现有的机器学习方法。所提出的实现采用梯度下降进行交替优化。为了评估,我们将我们的方法应用于来自一个大型单中心儿科心脏病学实践的2000多份患者记录,以预测患者是否被诊断患有心脏病。我们的方法与潜在语义索引、潜在狄利克雷分配和局部Fisher判别分析进行了比较。使用AUC、MCC、特异性和敏感性评估结果。结果表明,监督拉普拉斯特征映射是我们研究中表现最好的方法,AUC和MCC分别达到0.782和0.374。与排除文本数据的基线相比,SLE的AUC提高了8.16%,MCC提高了20.6%;与无监督拉普拉斯特征映射相比,AUC和MCC分别提高了2.69%和5.35%。该方法使许多现有的机器学习预测器能够有效且高效地利用文本预测器的潜力。
引用
@article{arxiv.1207.7035,
title = {Supervised Laplacian Eigenmaps with Applications in Clinical Diagnostics for Pediatric Cardiology},
author = {Thomas Perry and Hongyuan Zha and Patricio Frias and Dadan Zeng and Mark Braunstein},
journal= {arXiv preprint arXiv:1207.7035},
year = {2012}
}