使用粗糙集识别中风指标
机器学习
2021-10-22 v1
摘要
中风被广泛认为是第二常见的死亡原因。中风的不良后果引发了全球对改进中风管理与诊断的兴趣和工作。全球已使用多种数据挖掘技术,基于与患者电子健康记录(EHRs)相关的风险因素准确预测中风发生。特别地,EHRs通常包含数千个特征,其中大多冗余且无关,需被丢弃以提升预测精度。特征选择方法的选择有助于提升模型预测精度及归档输入特征的高效数据管理。本文系统分析EHR记录中用于检测中风的各种特征。我们提出一种新颖的基于粗糙集的技术,用于对各类EHR记录在检测中风中的重要性排序。与常规粗糙集技术不同,我们所提技术可应用于任何由二元特征集组成的数据集。我们在公开可用的EHR数据集上评估了所提方法,并得出结论:年龄、平均葡萄糖水平、心脏病和高血压是检测患者中风的最关键属性。此外,我们将所提技术与其它流行特征选择技术进行基准比较。我们在对个体特征检测中风重要性排序中取得了最佳性能。
引用
@article{arxiv.2110.10152,
title = {Identifying Stroke Indicators Using Rough Sets},
author = {Muhammad Salman Pathan and Jianbiao Zhang and Deepu John and Avishek Nag and Soumyabrata Dev},
journal= {arXiv preprint arXiv:2110.10152},
year = {2021}
}
备注
Accepted in IEEE Access, 2020