中文

基于规则、特征与深度神经方法的荷兰语医疗记录去标识化比较

计算与语言 2020-01-17 v1

摘要

电子健康记录中的非结构化信息为医学研究提供了宝贵的资源。为保护患者隐私并符合隐私法规,去标识化方法可自动从医疗记录中移除个人身份信息。然而,由于标注数据的缺乏,现有研究大多局限于英文医疗文本,去标识化方法跨语言与跨领域的泛化能力尚不明晰。本研究通过从荷兰医疗的9家机构和三个领域采样数据,构建了包含1260名患者医疗记录的多样化数据集。我们测试了三种去标识化方法的跨语言与跨领域泛化能力。实验表明,现有专为荷兰语开发的基于规则的方法无法泛化至该新数据。此外,一种最先进的神经架构在跨语言与跨领域上表现强劲,即便训练数据有限亦然。与基于特征和基于规则的方法相比,神经方法所需的配置工作与领域知识显著更少。我们向研究界开放所有代码与预训练去标识化模型,便于从业者将其应用于自身数据集并支持未来基准测试。

关键词

引用

@article{arxiv.2001.05714,
  title  = {Comparing Rule-based, Feature-based and Deep Neural Methods for De-identification of Dutch Medical Records},
  author = {Jan Trienes and Dolf Trieschnigg and Christin Seifert and Djoerd Hiemstra},
  journal= {arXiv preprint arXiv:2001.05714},
  year   = {2020}
}

备注

Proceedings of the 1st ACM WSDM Health Search and Data Mining Workshop (HSDM2020), 2020