中文

PIKS:一种通过开放医疗数据识别可供政策制定者行动之趋势的技术

机器学习 2023-04-06 v1 计算机与社会

摘要

随着对提高透明度的呼吁,政府正在多个领域(包括金融、教育和医疗)发布更大量的数据。医疗数据的高效探索性分析构成了一项重大挑战。公共卫生中的关键问题包括快速识别和分析趋势,以及检测离群值。这使得政策能够迅速适应不断变化的环境。我们提出了一种高效的离群值检测技术,称为 PIKS(Pruned iterative-k means searchlight,剪枝迭代 k 均值探照灯),它将迭代 k-means 算法与基于剪枝探照灯的扫描相结合。我们应用该技术在来自纽约州规划与研究合作系统(New York Statewide Planning and Research Cooperative System)和加州卫生规划与发展办公室(California's Office of Statewide Health Planning and Development)的两个公开可用医疗数据集中识别离群值。我们将我们的技术与另外三种现有离群值检测技术进行了比较,包括自动编码器(auto-encoders)、孤立森林(isolation forests)和特征装袋(feature bagging)。我们识别出了包括自杀率、免疫障碍、社会收容、心肌病以及妊娠晚期等状况中的离群值。我们证明 PIKS 技术产生的结果与其他技术(如自动编码器)一致。然而,自动编码器需要训练,这要求调优若干参数。相比之下,PIKS 技术需要调优的参数要少得多。这使其有利于快速、“开箱即用”的数据探索。PIKS 技术具有可扩展性,并且可以轻松摄取新数据集。因此,它可以为公民、患者和政策制定者提供有价值的、最新的见解。我们已将代码开源,并且随着开放数据的可用性,其他研究人员可以轻松复现和扩展我们的工作。这将有助于促进对医疗政策和公共卫生问题的更深入理解。

关键词

引用

@article{arxiv.2304.02208,
  title  = {PIKS: A Technique to Identify Actionable Trends for Policy-Makers Through Open Healthcare Data},
  author = {A. Ravishankar Rao and Subrata Garai and Soumyabrata Dey and Hang Peng},
  journal= {arXiv preprint arXiv:2304.02208},
  year   = {2023}
}