大语言模型体内的提示注入攻击
密码学与安全
2025-03-20 v1 人工智能
机器学习
摘要
视觉语言人工智能模型( VLM) 具备医学知识,可在众多 healthcare 场景中作为图像解释器、虚拟记者或通用决策支持系统使用。然而,本文演示当前应用于医学任务的 VLM 存在根本性安全缺陷:可通过提示注入攻击( prompt injection attacks) 进行攻击,这类攻击无需访问模型参数即可输出有害信息。我们进行定量研究,评估了四个最先进 VLM 对此类攻击的脆弱性:Claude 3 Opus、Claude 3.5 Sonnet、Reka Core 和 GPT-4o。使用 N=297 个攻击手段,我们展示所有这些模型都易受攻击。具体而言,我们展示将亚视觉提示嵌入医学影像数据可导致模型提供有害输出,且这些提示对人类观察者而言是不明显的。因此,本研究揭示了医学 VLM 的关键漏洞,应在大规模临床采用前予以缓解。
引用
@article{arxiv.2407.18981,
title = {Prompt Injection Attacks on Large Language Models in Oncology},
author = {Jan Clusmann and Dyke Ferber and Isabella C. Wiest and Carolin V. Schneider and Titus J. Brinker and Sebastian Foersch and Daniel Truhn and Jakob N. Kather},
journal= {arXiv preprint arXiv:2407.18981},
year = {2025}
}
备注
57 Pages, 5 Figures