中文

基于深度学习的去标识算法中受保护健康信息泄露的分析

机器学习 2021-05-24 v2 数值分析 数值分析

摘要

用于分析医疗数据(包括去标识任务)的算法日益复杂,增加了复杂算法不仅学习问题的一般表示、还学习数据中特定个体的可能性。现代法律框架明确禁止有意或意外分发患者数据,但尚未解决这一受保护健康信息泄露的潜在途径。现代深度学习算法因模型复杂性而具有最高的此类泄露风险。该领域近期研究在非医疗数据中突显了此类问题,但所有分析都可能特定于数据和算法。因此,我们选择分析一种基于 LSTM(长短期记忆)的先进自由文本去标识算法及其对训练集中任何个体进行编码的潜力。使用 i2b2 Challenge Data,我们训练然后分析该模型,以评估在分类器压缩层之前的 LSTM 输出是否可用于估计训练数据的成员关系。此外,我们使用包括成员推断攻击方法在内的不同攻击来攻击模型。结果表明,这些攻击无法基于模型输出区分训练数据成员与非成员。这表明模型未提供任何用于识别训练数据集中个体的有力证据,且尚无经验证据表明将其分发用于一般使用是不安全的。

关键词

引用

@article{arxiv.2101.12099,
  title  = {An Analysis Of Protected Health Information Leakage In Deep-Learning Based De-Identification Algorithms},
  author = {Salman Seyedi and Li Xiong and Shamim Nemati and Gari D. Clifford},
  journal= {arXiv preprint arXiv:2101.12099},
  year   = {2021}
}

备注

8 pages, 5 figures, PPAI-2021