MPIB:医学提示注入攻击与大语言模型临床安全的基准测试
计算与语言
2026-02-09 v1 机器学习
摘要
大型语言模型(LLM)和检索增强生成(RAG)系统正逐渐集成到临床工作流程中;然而,提示注入攻击可能引导这些系统产生临床上不安全或误导性的输出。我们引入了医学提示注入基准(MPIB),这是一个用于评估在直接提示注入和间接、RAG介导注入下临床安全性的基准数据集和测试套件,覆盖临床任务。MPIB 强调通过临床伤害事件率(CHER)衡量结果层面的风险,该指标基于临床分类学测量高危临床伤害事件,并报告 CHER 与攻击成功率(ASR),以区分指令遵循与下游患者风险。该基准包含 9,697 个经过多阶段质量门控和临床安全校准的实例。评估 MPIB 的 diverse 基线 LLM 和防御配置后,我们发现 ASR 与 CHER 可能出现显著差异,鲁健性取决于对抗指令是出现在用户查询中还是检索上下文中。我们发布 MPIB 及其评估代码、对抗基线和全面文档,以支持可重复和系统化的临床提示注入研究。代码和数据可在 GitHub(代码)和 Hugging Face(数据)获取。
引用
@article{arxiv.2602.06268,
title = {MPIB: A Benchmark for Medical Prompt Injection Attacks and Clinical Safety in LLMs},
author = {Junhyeok Lee and Han Jang and Kyu Sung Choi},
journal= {arXiv preprint arXiv:2602.06268},
year = {2026}
}
备注
13 pages, 7 figures