黑盒行为蒸馏破坏医学 LLM 的安全对齐
机器学习
2025-12-11 v1
摘要
随着医学大语言模型(LLMs)越来越多地集成到临床工作流程中,对对齐鲁棒性和安全性的担忧日益加剧。此前关于模型提取的研究集中于分类模型或记忆泄漏,而安全对齐的生成式医学 LLM 的脆弱性尚未得到充分探索。我们提出了一种黑盒蒸馏攻击,仅通过输出级访问即可复制安全对齐医学 LLM 的领域特定推理能力。通过向 Meditron-7B 发出 48,000 条指令查询并收集 25,000 条良性指令-响应对,我们在零对齐监督设置下使用参数高效的 LoRA 微调了一个 LLaMA3 8B 代理模型,无需访问模型权重、安全过滤器或训练数据。该代理模型仅花费 $12 即可在良性输入上保持强保真度,同时对 86% 的对抗提示产生不安全输出,远超 Meditron-7B(66%)和未调优基线模型(46%)。这揭示了一个显著的功能-伦理差距:任务效用得以迁移,而对齐崩溃。为分析这一崩溃,我们开发了一个动态对抗评估框架,结合基于生成查询(GQ)的有害提示生成、验证器过滤、类别级失败分析以及自适应随机搜索(RS)越狱攻击。我们还提出了一种分层防御系统,作为黑盒部署中实时对齐漂移的原型检测器。我们的发现表明,仅基于良性数据的黑盒蒸馏暴露了一个实际且未被充分认识的威胁:攻击者可以低成本地复制医学 LLM 的能力,同时剥离安全机制,凸显了提取感知安全监控的必要性。
引用
@article{arxiv.2512.09403,
title = {Black-Box Behavioral Distillation Breaks Safety Alignment in Medical LLMs},
author = {Sohely Jahan and Ruimin Sun},
journal= {arXiv preprint arXiv:2512.09403},
year = {2025}
}