高效但脆弱:基准测试与防御 LLM 批量提示攻击
密码学与安全
2025-06-23 v2 人工智能
机器学习
摘要
批量提示将多个共享相同上下文的查询组合在一个推理中,以减少推理成本,已成为一种有前景的解决方案。然而,我们的研究揭示了批量提示的显著安全漏洞:恶意用户可将攻击指令注入批量提示中,导致所有查询之间产生意外干扰,可能导致包含有害内容(如钓鱼链接)或逻辑推理中断。在本文中,我们构建了 BATCHSAFEBENCH,一个包含 150 种攻击指令(两种类型)和 8k 个批量实例的综合性基准测试,以系统性地研究批量提示漏洞。我们对闭源和开源 LLM 进行评估,结果显示所有 LLM 都易受批量提示攻击。随后,我们探索了多种防御方法。尽管基于提示的防御对较小的 LLM 效果有限,但基于探测的方法在检测攻击时准确率可达约 95%。此外,我们进行了机械分析以理解该攻击并识别负责任的注意力头。
引用
@article{arxiv.2503.15551,
title = {Efficient but Vulnerable: Benchmarking and Defending LLM Batch Prompting Attack},
author = {Murong Yue and Ziyu Yao},
journal= {arXiv preprint arXiv:2503.15551},
year = {2025}
}
备注
Accepted to ACL Findings, 2025