探索临床大语言模型中的成员推理漏洞
密码学与安全
2025-10-22 v1 人工智能
摘要
随着大语言模型(LLM)日益深入地应用于临床决策支持、文档记录和患者信息系统,确保其隐私性和可信度已成为医疗保健领域的一项迫切挑战。在敏感的电子健康记录(EHR)数据上微调 LLM 可以改善领域对齐,但也增加了通过模型行为暴露患者信息的风险。在这项进行中的工作里,我们对临床 LLM 中的成员推理漏洞进行了探索性实证研究,重点关注对手是否能推断特定患者记录是否被用于模型训练。使用最先进的临床问答模型 Llemr,我们评估了典型的基于损失的攻击以及一种基于领域动机的基于释义的扰动策略,后者更真实地反映了临床对抗条件。我们的初步发现揭示了有限但可测量的成员信息泄露,表明当前的临床 LLM 提供了部分抵抗力,但仍然容易受到微妙的隐私风险影响,这可能削弱对临床 AI 应用的信任。这些结果推动了上下文感知、特定领域隐私评估与防御方法的持续开发,例如差分隐私微调和释义感知训练,以加强医疗保健 AI 系统的安全性和可信度。
引用
@article{arxiv.2510.18674,
title = {Exploring Membership Inference Vulnerabilities in Clinical Large Language Models},
author = {Alexander Nemecek and Zebin Yun and Zahra Rahmani and Yaniv Harel and Vipin Chaudhary and Mahmood Sharif and Erman Ayday},
journal= {arXiv preprint arXiv:2510.18674},
year = {2025}
}
备注
Accepted at the 1st IEEE Workshop on Healthcare and Medical Device Security, Privacy, Resilience, and Trust (IEEE HMD-SPiRiT)