关于群组查询幻觉攻击的研究
密码学与安全
2025-08-28 v1 人工智能
计算与语言
摘要
随着大语言模型(LLM)的广泛使用,理解其在用户交互过程中的潜在失效模式至关重要。在实际应用中,用户通常在与 LLM 的一次对话中提出多个问题。因此,在本研究中,我们提出了群组查询攻击(Group Query Attack),这是一种通过同时向 LLM 呈现一组查询来模拟此场景的技术。我们研究了连续提示中累积的上下文如何影响 LLM 的输出。具体而言,我们观察到群组查询攻击显著降低了在特定任务上微调的模型的性能。此外,我们证明群组查询攻击会引发触发 LLM 潜在后门的风险。另外,群组查询攻击在涉及推理的任务(例如预训练和对齐模型的数学推理和代码生成)中同样有效。
引用
@article{arxiv.2508.19321,
title = {An Investigation on Group Query Hallucination Attacks},
author = {Kehao Miao and Xiaolong Jin},
journal= {arXiv preprint arXiv:2508.19321},
year = {2025}
}