纵向临床叙述的自动去标识研究综述
人工智能
2018-10-17 v1 计算与语言
摘要
医疗数据(也称为电子健康记录)在研究中的使用有助于发展和推进医学科学。然而,在使用医疗数据进行分析的同时保护患者机密与身份至关重要。医疗数据可采取表格结构(即表)、自由形式叙述和图像的形式。本研究聚焦于自由形式纵向文本中的医疗数据。电子健康记录的去标识提供了在不会影响患者隐私的情况下将此类数据用于研究的机会,并避免了获取患者个人同意的需要。近年来,人们对开发准确、鲁棒且可适应的电子健康记录自动去标识系统兴趣日增。这主要是由于大量健康数据的可用性与因法律与伦理限制而无法在研究中使用此类数据之间的困境。诸如 2014 i2b2 UTHealth 与 2016 CEGS N-GRID 共享任务中的去标识赛道为推进该领域提供了极佳平台。其主要原因包括数据集的开源性质以及 2016 年竞赛使用了原始精神病学数据。本研究聚焦于纵向临床叙述自动去标识开发中技术使用的显著趋势变化。更具体地说,从仅使用基于条件随机场(CRF)的系统或仅基于规则(正则表达式、词典或组合)的系统,转向混合模型(结合 CRF 与规则),以及最近转向基于深度学习的系统。我们回顾了源于 2014 与 2016 年竞赛的文献与结果,并讨论了这些系统的产出。我们还提供了一份由本综述浮现的研究问题清单。
引用
@article{arxiv.1810.06765,
title = {A survey of automatic de-identification of longitudinal clinical narratives},
author = {Vithya Yogarajan and Michael Mayo and Bernhard Pfahringer},
journal= {arXiv preprint arXiv:1810.06765},
year = {2018}
}