过于易被欺骗?prompt injection 破坏多选择题中的 LLM
密码学与安全
2025-08-20 v1 人工智能
摘要
大型语言模型(LLMs)最近在复杂推理和零样子推理方面展现出强大的涌现能力,展现出在教育、同行评审和数据质量评估中作为判官的非凡潜力。然而,其在prompt injection攻击下的鲁棒性——即将恶意指令嵌入内容以操纵输出——仍是值得关注的风险。在本工作中,我们探索一种令人惊讶简单却高效的攻击方式,以测试LLMs是否易被误导。具体而言,我们评估LLMs在处理基本算术问题(如"3 + 2是多少?")时的表现,这些问题以多选或真假判断形式呈现于PDF文件中,而文件中隐藏了prompt injection。我们的结果显示,LLMs确实容易受到此类隐藏prompt injection攻击的影响,即便在这些平凡场景下也亦如此,这凸显了LLM作为判官应用的严重鲁棒性风险。
引用
@article{arxiv.2508.13214,
title = {Too Easily Fooled? Prompt Injection Breaks LLMs on Frustratingly Simple Multiple-Choice Questions},
author = {Xuyang Guo and Zekai Huang and Zhao Song and Jiahao Zhang},
journal= {arXiv preprint arXiv:2508.13214},
year = {2025}
}