BERT 在临床笔记上的预训练是否会泄露敏感数据?
计算与语言
2021-04-26 v2 人工智能
机器学习
摘要
在来自电子健康记录(EHR)的临床笔记上预训练的大型 Transformer 为预测性临床任务带来了显著的性能提升。训练此类模型的成本(以及为此所需的数据访问)与其效用共同催生了参数共享的动机,即发布诸如 ClinicalBERT 之类的预训练模型。尽管多数工作使用了去标识化的 EHR,许多研究人员仍能访问大量敏感的、未去标识化的 EHR,并可能用以训练 BERT 模型(或类似模型)。若他们这样做了,发布该模型的权重是否安全?在本工作中,我们设计了一系列方法,旨在从训练好的 BERT 中恢复受保护健康信息(PHI)。具体而言,我们尝试恢复患者姓名及其相关联的病情。我们发现,简单的探测方法无法从在 MIMIC-III 的 EHR 语料上训练的 BERT 中有意义地提取敏感信息。然而,更复杂的“攻击”可能成功做到这一点:为促进此类研究,我们将实验设置与基线探测模型发布于 https://github.com/elehman16/exposing_patient_data_release
引用
@article{arxiv.2104.07762,
title = {Does BERT Pretrained on Clinical Notes Reveal Sensitive Data?},
author = {Eric Lehman and Sarthak Jain and Karl Pichotta and Yoav Goldberg and Byron C. Wallace},
journal= {arXiv preprint arXiv:2104.07762},
year = {2021}
}
备注
NAACL Camera Ready Submission