LLM 语义保持对抗攻击:自适应贪婪二分查找方法
计算与语言
2025-06-24 v1 密码学与安全
摘要
大型语言模型(LLMs)越来越依赖于图形用户界面(GUI)中的自动提示工程来细化用户输入并提高响应准确性。然而,用户需求的多样性常常导致意外误解,自动优化会扭曲原始意图并产生错误输出。为此,我们提出自适应贪婪二分查找(AGBS)方法,通过模拟常见的提示优化机制同时保持语义稳定来实现对抗样本生成。我们的 approach 动态评估此类策略对 LLM 性能的影响,从而实现鲁棒的对抗样本生成。通过在开源和闭源 LLMs 上进行大量实验,我们展示 AGBS 在平衡语义一致性和攻击效能方面的有效性。我们的发现为设计更可靠的提示优化系统提供了可操作的见解。代码可在 https://github.com/franz-chang/DOBS 获取。
引用
@article{arxiv.2506.18756,
title = {Semantic-Preserving Adversarial Attacks on LLMs: An Adaptive Greedy Binary Search Approach},
author = {Chong Zhang and Xiang Li and Jia Wang and Shan Liang and Haochen Xue and Xiaobo Jin},
journal= {arXiv preprint arXiv:2506.18756},
year = {2025}
}
备注
19 pages, 8 figures