REALISTA:现实感潜在对抗攻击以诱发 LLM 幻觉
计算与语言
2026-05-14 v1 人工智能
密码学与安全
机器学习
摘要
大型语言模型 (LLM) 在诸多任务上取得了强大的性能,但仍然容易产生幻觉,这就催生了寻找现实感对抗性提示以诱发此类失效的需求。我们将幻觉诱发问题形式化为一个受约束的优化问题,目标是找到与良性用户提示等价且语义连贯的对抗性提示。现有方法仍受限:离散基于提示的攻击保留语义等价性和连贯性,但仅在有限的提示变体集合上进行搜索;而连续潜在空间攻击则探索更丰富的空间,但往往解码为不再是有效重述的提示。为克服这些限制,我们提出了 REALISTA—a 现实感潜在空间攻击框架。REALISTA 构建了一个输入依赖的编辑方向字典,每种方向对应于语义等价且连贯的重述,然后对这些方向的连续组合进行优化。该设计将连续攻击的优化灵活性与离散重述式攻击的语义现实性相结合。实验表明,REALISTA 在开源 LLM 上实现了优于或相当于最先进现实感攻击的性能,关键的是,在自由形式响应设置下成功攻击大型推理模型,而先前的现实感攻击则失败。代码可在 https://github.com/Buyun-Liang/REALISTA 查看。
引用
@article{arxiv.2605.12813,
title = {REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations},
author = {Buyun Liang and Jinqi Luo and Liangzu Peng and Kwan Ho Ryan Chan and Darshan Thaker and Kaleab A. Kinfu and Fengrui Tian and Hamed Hassani and René Vidal},
journal= {arXiv preprint arXiv:2605.12813},
year = {2026}
}
备注
Accepted at ICML 2026. Code is available at https://github.com/Buyun-Liang/REALISTA