中文

超越数据量:复杂数据对机器学习流程的影响

计算机与社会 2018-01-29 v2 机器学习 机器学习

摘要

从病历到国家人口普查,医疗保健传统上一直在基于纸质文档的模式下运行。然而,过去十年标志着医疗保健迈入数字时代的漫长而艰巨的转型。从电子健康记录,到数字化影像和实验室报告,再到公共卫生数据集,如今的医疗保健生成了海量的数字信息。如此丰富的数据为集成机器学习解决方案提供了激动人心的机会,以解决医疗保健实践和管理多个方面的问题。遗憾的是,获取准确且富有信息量的洞见所需的不仅仅是执行机器学习模型的能力。相反,对运行模型所依赖的数据有更深入的理解对于其成功至关重要。虽然人们已经付出了巨大努力来开发能够处理在分析数百万数字化患者记录期间所获数据量的模型,但重要的是要记住,数据量仅代表数据的一个方面。事实上,由于数据来源日益多样化,医疗保健数据呈现出极其复杂的属性集合,在整个机器学习流程中必须将这些属性考虑在内。本章重点强调这些挑战,并分为三个不同的部分,每个部分代表流程的一个阶段。我们首先考虑在预处理阶段需考虑的数据属性,然后转向模型构建阶段的考量,最后以模型输出解释面临的挑战结束。对于每个部分,我们围绕与医疗保健领域相关的数据进行了讨论,并深入探讨了它们可能对机器学习技术的效率造成的挑战。

关键词

引用

@article{arxiv.1706.01513,
  title  = {Beyond Volume: The Impact of Complex Healthcare Data on the Machine Learning Pipeline},
  author = {Keith Feldman and Louis Faust and Xian Wu and Chao Huang and Nitesh V. Chawla},
  journal= {arXiv preprint arXiv:1706.01513},
  year   = {2018}
}

备注

Healthcare Informatics, Machine Learning, Knowledge Discovery: 20 Pages, 1 Figure