基于识别预测试的 ASCII 艺术式 LLM 恶意攻击框架 ArtPerception
密码学与安全
2025-10-28 v1 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
将大语言模型 (LLMs) 集成到计算机应用中带来了变革性能力,但也引入了显著的安全挑战。现有安全对齐主要聚焦语义解释,使 LLMs 易受非标准数据表示形式的攻击。本文引入 ArtPerception,一种新型黑盒恶意攻击框架,战略性地利用 ASCII 艺术规避 SOTA LLMs 的安全措施。不同于依赖迭代式蛮力攻击的先前方法,ArtPerception 提出系统性的两阶段方法。阶段 1 进行一次针对模型的预测试,以经验方式确定 ASCII 艺术识别的最优参数。阶段 2 基于这些洞察发起高度有效的单次恶意攻击。我们提出 Modified Levenshtein Distance (MLD) 指标,以更细致评估 LLM 识别能力。通过对四个 SOTA 开源 LLMs 的全面实验,展示其优越的攻击性能。我们进一步通过在 GPT-4o、Claude Sonnet 3.7 和 DeepSeek-V3 等领先商业模型上验证成功的可迁移性,并对可能的防御措施如 LLaMA Guard 和 Azure 内容过滤器进行严格的有效性分析。我们的发现表明,真正的 LLM 安全需要防御文本输入在多模态解释空间中的攻击,战略性、基于侦察的攻击具有有效性。内容警告:本文包含potentially 有害和冒犯性模型输出。
引用
@article{arxiv.2510.10281,
title = {ArtPerception: ASCII Art-based Jailbreak on LLMs with Recognition Pre-test},
author = {Guan-Yan Yang and Tzu-Yu Cheng and Ya-Wen Teng and Farn Wanga and Kuo-Hui Yeh},
journal= {arXiv preprint arXiv:2510.10281},
year = {2025}
}
备注
30 pages, 22 figures. This preprint has been accepted for publication in Elsevier JOURNAL OF NETWORK AND COMPUTER APPLICATIONS (JNCA)