面向LLM-as-a-Judge的基于优化的提示注入攻击
密码学与安全
2025-08-26 v5 人工智能
摘要
LLM-as-a-Judge使用大语言模型(LLM)从给定问题的候选答案集中选择最佳答案。LLM-as-a-Judge有许多应用,例如基于LLM的搜索、基于AI反馈的强化学习(RLAIF)和工具选择。在这项工作中,我们提出了JudgeDeceiver,一种针对LLM-as-a-Judge的基于优化的提示注入攻击。JudgeDeceiver将精心设计的序列注入到攻击者控制的候选答案中,使得对于攻击者选择的问题,无论其他候选答案是什么,LLM-as-a-Judge都会选择该候选答案。具体来说,我们将寻找此类序列的问题表述为一个优化问题,并提出一种基于梯度的方法来近似求解。我们的广泛评估表明,JudgeDeceiver非常有效,并且比现有的手动设计注入序列的提示注入攻击以及扩展到我们问题时的越狱攻击有效得多。我们还在三个案例研究中展示了JudgeDeceiver的有效性,即基于LLM的搜索、RLAIF和工具选择。此外,我们考虑了防御措施,包括已知答案检测、困惑度检测和困惑度滑动窗口检测。我们的结果表明这些防御措施不足,凸显了开发新防御策略的迫切需求。我们的实现可在以下仓库获取:https://github.com/ShiJiawenwen/JudgeDeceiver。
引用
@article{arxiv.2403.17710,
title = {Optimization-based Prompt Injection Attack to LLM-as-a-Judge},
author = {Jiawen Shi and Zenghui Yuan and Yinuo Liu and Yue Huang and Pan Zhou and Lichao Sun and Neil Zhenqiang Gong},
journal= {arXiv preprint arXiv:2403.17710},
year = {2025}
}
备注
To appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2024