一种易用且鲁棒的临床试验文本文档差分隐私去标识方法
密码学与安全
2022-11-03 v1 人工智能
摘要
非结构化文本数据是医疗系统的核心。出于明显的隐私原因,这些文档在包含个人可识别信息期间不对研究者开放。在尊重立法框架(尤其是GDPR或HIPAA)的前提下共享此类数据的一种方式是,在医疗机构内对其进行去标识,即通过命名实体识别(NER)系统检测个人信息的实体,随后将其替换,使文档难以关联到特定个人。挑战在于拥有可靠的NER与替换工具,且不损害文档的机密性与一致性。多数已有研究聚焦于英语医疗文档,采用粗粒度替换且未利用隐私保护进展。本文展示了如何通过强化较不鲁棒的标识方法,并适配当前最优的差分隐私机制用于替换,从而实现高效且差分私密的去标识方法。成果是一种针对法语临床文档的去标识方法,亦可推广至其他语言,且其鲁棒性得到数学证明。
引用
@article{arxiv.2211.01147,
title = {An Easy-to-use and Robust Approach for the Differentially Private De-Identification of Clinical Textual Documents},
author = {Yakini Tchouka and Jean-François Couchot and David Laiymani},
journal= {arXiv preprint arXiv:2211.01147},
year = {2022}
}