面向机器学习任务的法语非结构化临床笔记去标识化
密码学与安全
2023-10-09 v2 机器学习
摘要
非结构化文本数据处于卫生系统的核心:医生之间的联络信、手术报告、根据 ICD-10 标准的操作编码等。这些文档中包含的细节有助于更好地了解患者、更好地管理患者、更好地研究病症、准确地报销相关的医疗行为……所有这些似乎今天至少部分可通过人工智能技术实现。然而,出于明显的隐私保护原因,只要这些文档包含识别数据,这些 AI 的设计者就没有合法权利访问它们。对这些文档去标识化,即检测并删除其中所有识别信息,是在两个互补世界之间共享此数据的法律必要步骤。在过去十年中,已提出若干去标识化文档的提案,主要是英文的。虽然检测分数通常很高,但替换方法通常对攻击的鲁棒性较差。在法语方面,极少有方法基于任意的检测和/或替换规则。在本文中,我们提出了一种专用于法语医疗文档的新的全面去标识化方法。识别元素检测(基于深度学习)及其替换(基于差分隐私)的方法均基于现有最成熟的方法。结果是一种有效保护这些医疗文档核心患者隐私的方法。整个方法已在某法国公立医院的一个法语医疗数据集上进行了评估,结果非常令人鼓舞。
引用
@article{arxiv.2209.09631,
title = {De-Identification of French Unstructured Clinical Notes for Machine Learning Tasks},
author = {Yakini Tchouka and Jean-François Couchot and Maxime Coulmeau and David Laiymani and Philippe Selles and Azzedine Rahmani},
journal= {arXiv preprint arXiv:2209.09631},
year = {2023}
}