中文

具有隐私保障的可控合成临床笔记生成

计算与语言 2024-09-13 v1 机器学习

摘要

在机器学习领域,领域特定的标注数据是训练有效模型的宝贵资源。然而,在医学领域,这些数据常包含个人健康信息 (PHI),引发重大的隐私 concerns。围绕 PHI 的严格法规限制了医疗数据集的可用性和共享,这对旨但开发先进机器学习模型的研究人员和实践者构成了重大挑战。本文我们引入了一种新方法来“克隆”包含 PHI 的数据集。我们的 method 确保克隆后的数据集在不损害患者隐私的前提下,保留原始数据的关键特征和实用性。通过利用差分隐私技术和一种新的微调任务,我们的方法产生无可识别信息的数据集,同时保留必要用于模型训练的统计特性。我们进行了实用性测试,以评估在克隆数据集上训练的机器学习模型性能。结果表明,克隆后的数据集不仅满足隐私标准,而且与在传统匿名数据集上训练的模型相比还能提升模型性能。这项工作为在机器学习中有效且伦理地利用敏感医疗数据提供了可行方案,推动了医学研究的进展以及健壮预测模型的开发。

关键词

引用

@article{arxiv.2409.07809,
  title  = {Controllable Synthetic Clinical Note Generation with Privacy Guarantees},
  author = {Tal Baumel and Andre Manoel and Daniel Jones and Shize Su and Huseyin Inan and Aaron and Bornstein and Robert Sim},
  journal= {arXiv preprint arXiv:2409.07809},
  year   = {2024}
}