中文

训练私有临床语言模型:面向 ICD-9 编码的隐私保留管线比较研究

机器学习 2025-11-20 v1 计算与语言

摘要

在临床文本上训练的大型语言模型风险暴露敏感患者信息,但差分隐私(DP)方法常严重降低部署所需的诊断准确率。尽管 DP 优化和文本生成领域取得了快速进展,但仍不清楚哪种隐私保留策略对临床语言任务最有效。我们present了首个针对医院出院病程笔记中自动诊断编码的四种训练管线的系统性头盆比较。所有管线均使用相同的 10 亿参数模型和匹配的隐私预算预测 ICD-9 编码。在中等和放宽的隐私预算(ε{4,6}\varepsilon \in \{4, 6\})下,知识蒸馏从 DP 训练的教师模型中获得的性能优于直接的 DP-SGD 和 DP-合成数据训练,在保持强大经验隐私(成员推断 AUC \approx 0.5)的同时,恢复了最高可达非私有性能的 63%。这些发现揭示了不同架构在隐私-效用权衡方面的显著差异,并确定知识蒸馏是实现隐私保留临床 NLP 最实用的路径。

关键词

引用

@article{arxiv.2511.14936,
  title  = {How to Train Private Clinical Language Models: A Comparative Study of Privacy-Preserving Pipelines for ICD-9 Coding},
  author = {Mathieu Dufour and Andrew Duncan},
  journal= {arXiv preprint arXiv:2511.14936},
  year   = {2025}
}

备注

10 pages, 5 figures. Accepted to the Privacy-Preserving Machine Learning Workshop at EurIPS 2025