中文

过于易被欺骗?prompt injection 破坏多选择题中的 LLM

密码学与安全 2025-08-20 v1 人工智能

摘要

大型语言模型(LLMs)最近在复杂推理和零样子推理方面展现出强大的涌现能力,展现出在教育、同行评审和数据质量评估中作为判官的非凡潜力。然而,其在prompt injection攻击下的鲁棒性——即将恶意指令嵌入内容以操纵输出——仍是值得关注的风险。在本工作中,我们探索一种令人惊讶简单却高效的攻击方式,以测试LLMs是否易被误导。具体而言,我们评估LLMs在处理基本算术问题(如"3 + 2是多少?")时的表现,这些问题以多选或真假判断形式呈现于PDF文件中,而文件中隐藏了prompt injection。我们的结果显示,LLMs确实容易受到此类隐藏prompt injection攻击的影响,即便在这些平凡场景下也亦如此,这凸显了LLM作为判官应用的严重鲁棒性风险。

关键词

引用

@article{arxiv.2508.13214,
  title  = {Too Easily Fooled? Prompt Injection Breaks LLMs on Frustratingly Simple Multiple-Choice Questions},
  author = {Xuyang Guo and Zekai Huang and Zhao Song and Jiahao Zhang},
  journal= {arXiv preprint arXiv:2508.13214},
  year   = {2025}
}