基于最优特征选择的无监督逻辑回归(OFS-ULR)模型与 Spark Streaming 对 lifelog 数据的实证分析
机器学习
2022-04-13 v2 分布式、并行与集群计算
摘要
普适健康监控系统的近期进展导致实时生成大量 lifelog 数据。慢性疾病是发展中国家和发达国家中最严重的健康挑战之一。据 WHO 统计,其占全部死亡的 73% 和全球疾病负担的 60%。慢性疾病分类模型正利用 lifelog 数据的潜力探索更好的医疗实践。本文旨在构建基于最优特征选择的无监督逻辑回归模型(OFS-ULR)以分类慢性疾病。由于 lifelog 数据因其敏感性而分析至关重要,传统分类模型表现出有限性能。因此,利用 lifelog 数据设计新的慢性疾病分类器是时代所需。构建良好模型的关键取决于数据集的预处理、识别重要特征,以及随后用合适超参数训练学习算法以获得更好性能。所提方法通过一系列步骤提升现有方法性能:(i)移除冗余或无效实例,(ii)利用聚类使数据带标签并将数据划分为类,(iii)通过应用领域知识或选择算法识别合适特征子集,(iv)模型超参数调优以获取最佳结果,(v)使用 Spark streaming 环境进行性能评估。为此,实验使用两个时间序列数据集计算准确率、召回率、精确率和 f1-score。实验分析证明了所提方法相较于传统分类器的适用性,且我们新建模型在所有模型中取得了最高准确率并降低了训练复杂度。
引用
@article{arxiv.2204.01281,
title = {Empirical Analysis of Lifelog Data using Optimal Feature Selection based Unsupervised Logistic Regression (OFS-ULR) Model with Spark Streaming},
author = {Sadhana Tiwari and Sonali Agarwal},
journal= {arXiv preprint arXiv:2204.01281},
year = {2022}
}
备注
Data analytics and Machine learning in healthcare