中文

MASK:一个用于促进临床文本去标识化的灵活框架

计算与语言 2020-10-13 v2 信息检索 机器学习

摘要

医疗健康记录和临床摘要包含大量文本形式的重要信息,有助于推进治疗、药物和公共卫生方面的研究。然而,这些信息中的大部分并未被共享,因为它们包含有关患者、其家属或治疗他们的医务人员的隐私信息。诸如美国的HIPPA、加拿大的PHIPPA以及GDPR等法规对这类信息的保护、处理和分发进行了规范。如果这些信息经过去标识化处理且个人信息被替换或删去,它们就可以被分发给研究社区。在本文中,我们提出了MASK,一个旨在执行去标识化任务的软件包。该软件能够使用一些最先进的技术执行命名实体识别,然后对识别出的实体进行掩码或删去处理。用户可以选择命名实体识别算法(目前已实现两个基于CRF的技术版本,以及使用预训练GLoVe和ELMo嵌入的基于BiLSTM的神经网络)和掩码算法(例如平移日期、替换姓名/位置、完全删去实体)。

关键词

引用

@article{arxiv.2005.11687,
  title  = {MASK: A flexible framework to facilitate de-identification of clinical texts},
  author = {Nikola Milosevic and Gangamma Kalappa and Hesam Dadafarin and Mahmoud Azimaee and Goran Nenadic},
  journal= {arXiv preprint arXiv:2005.11687},
  year   = {2020}
}