被遗忘的盾牌:医学多模态大语言模型中的参数空间安全镶嵌
机器学习
2026-01-09 v1 人工智能
计算与语言
摘要
医学多模态大语言模型(Medical MLLMs)在专门医学任务上取得了显著进展,但其安全研究滞后,潜在风险制约实际部署。本文首先建立多维度评估框架,系统性地对现有 SOTA Medical MLLMs 的安全性进行基准测试。我们的实证分析揭示了现有模型在通用和医学专属安全维度上普遍存在脆弱性,尤其是其对跨模态 jailbreak 攻击极其脆弱。进一步发现,医学微调过程常导致模型原始安全对齐的灾难性遗忘(catastrophic forgetting)。为此,我们提出一种 novel 的“参数空间干预”(Parameter-Space Intervention)方法,用于高效安全再对齐。该方法从原始基模型中提取内在的安全知识表征,并在构建医学能力的同时将其注入目标模型。此外,我们设计了细粒度参数搜索算法,以实现安全性与医学性能之间的最优权衡。实验结果表明,我们的方法显著提升了 Medical MLLMs 的安全护栏,无需额外的领域特定安全数据,同时尽量降低对核心医学性能的降解。
引用
@article{arxiv.2601.04199,
title = {The Forgotten Shield: Safety Grafting in Parameter-Space for Medical MLLMs},
author = {Jiale Zhao and Xing Mou and Jinlin Wu and Hongyuan Yu and Mingrui Sun and Yang Shi and Xuanwu Yin and Zhen Chen and Zhen Lei and Yaohua Wang},
journal= {arXiv preprint arXiv:2601.04199},
year = {2026}
}