面向 LLM 评判系统的对抗性攻击:从提示注入获取的洞察
密码学与安全
2025-04-28 v1 计算与语言
摘要
将大型语言模型(LLM)作为评判系统用于评估文本质量、代码正确性和论证力度时,容易受到提示注入攻击。我们引入一种框架,将内容作者攻击与系统提示攻击分离,并对五个模型(Gemma 3.27B、Gemma 3.4B、Llama 3.2 3B、GPT-4 和 Claude 3 Opus)在四个具有不同防御措施的任务上进行评估,每种条件下使用 50 个提示。攻击实现了最高 73.8% 的成功率,较小的模型更易受攻击,攻击的可迁移性范围在 50.5% 到 62.6% 之间。我们的结果与 Universal Prompt Injection 和 AdvPrompter 的结果不一致。我们建议采用多模型委员会和比较评分方法,并公开所有代码和数据集。
引用
@article{arxiv.2504.18333,
title = {Adversarial Attacks on LLM-as-a-Judge Systems: Insights from Prompt Injections},
author = {Narek Maloyan and Dmitry Namiot},
journal= {arXiv preprint arXiv:2504.18333},
year = {2025}
}