字母索引映射:通过语义差异性破解大语言模型
密码学与安全
2025-06-17 v1 人工智能
摘要
大语言模型(LLMs)已展现出显著能力,但其对对抗攻击的易受性,特别是越狱攻击,带来了重大的安全与伦理问题。虽然存在多种越狱方法,但许多方法存在计算开销大、令牌使用量高或解码方案复杂的问题。Liu 等人(2024)提出了 FlipAttack,一种通过简单提示操作实现高攻击成功率(ASR)的黑盒方法。本文通过分析 FlipAttack 翻转模式所引发的语义变化,探究其有效性的底层机制。我们假设原始提示与操作后提示之间的语义差异性与 ASR 呈负相关。为验证这一点,我们考察了嵌入空间可视化(UMAP、KDE)以及 FlipAttack 各模式的余弦相似度。此外,我们提出了一种新型对抗攻击——字母索引映射(AIM),旨在最大化语义差异性的同时保持简单的可解码性。在 AdvBench 子集上对 GPT-4 的实验表明,AIM 及其变体 AIM+FWO 实现了 94% 的 ASR,优于 FlipAttack 及其他方法。我们的结果表明,虽然高语义差异性至关重要,但与解码简洁性的平衡是成功越狱的关键。本工作有助于深入理解对抗提示机制,并提供了一种新的有效越狱技术。
引用
@article{arxiv.2506.12685,
title = {Alphabet Index Mapping: Jailbreaking LLMs through Semantic Dissimilarity},
author = {Bilal Saleh Husain},
journal= {arXiv preprint arXiv:2506.12685},
year = {2025}
}
备注
10 pages, 2 figures, 3 tables