琐碎的提示重构绕过Google MedGemma-4B的安全护栏
密码学与安全
2026-07-09 v1 人工智能
摘要
开放权重的医学语言模型越来越多地被用作面向患者和临床医生支持应用的基础。其模型卡禁止特定行为——推荐精确药物剂量、发布明确诊断、开具治疗方案、裁决药物相互作用,以及建议可以跳过紧急护理——但模型卡描述的是预期行为,而非稳健行为。我们量化了MedGemma-4B-it在不需要技术复杂性的攻击下的这一差距。我们构建了一个全因子基准,包含5个受保护行为概念×50个确定性模板化问题×6种非专业攻击方式×3次重复(4,500次生成),通过Ollama在默认采样下本地提供模型,并用三个独立评判器(LLM评判器、透明正则表达式评判器和NLI蕴含评判器)对每个响应进行拒绝/回避/遵从编码。在主要LLM评判器下,总体攻击成功率(ASR,即被编码为遵从的比例)为38.0%。两种将请求重新解释为合法的重构方式占主导地位:将问题重构为“医学委员会考试”项使ASR从29.0%的基线提高到53.1%(+24.0个百分点),而诉诸所谓的医生权威则将其提高到43.7%(+14.7);粗略的指令覆盖前缀没有显著效果。鲁棒性受主题主导:药物相互作用护栏几乎缺失(ASR为83.2%),而紧急转诊护栏很强(4.7%)——并且权威框架是唯一能突破它的攻击。我们报告了Wilson置信区间、聚类自举效应量、聚类稳健逻辑回归、Cochran's Q、每种方式的McNemar检验以及评判器间信度(Fleiss' kappa = 0.26);绝对ASR取决于评判器,而攻击和主题的排序则不然。我们的发现为开放医学模型在部署时提供更强的护栏提供了动机。
引用
@article{arxiv.2607.09804,
title = {Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B},
author = {Avi-ad Avraam Buskila},
journal= {arXiv preprint arXiv:2607.09804},
year = {2026}
}