中文

Casting a SPELL: 句子配对探索用于突破LLM限制

密码学与安全 2025-12-25 v1 人工智能 软件工程

摘要

大型语言模型(LLM)通过AI辅助编码工具 revolutionized 软件开发,使拥有有限编程专业知识的开发者能够创建复杂应用程序。然而,这种可及性也被恶意行为者利用,以生成有害软件。现有的越狱研究主要关注针对LLM的通用攻击场景,针对恶意代码生成的研究有限。为填补这一空白,我们提出SPELL,一个专为评估恶意代码生成安全对齐 weakness 而设计的全面测试框架。我们的框架采用时间分割选择策略,通过智能组合先前知识数据集中的句子来系统构建越狱提示,平衡新颖攻击模式的探索与成功技术的开发。广泛的评估覆盖三个先进代码模型(GPT-4.1、Claude-3.5和Qwen2.5-Coder),分别在八个恶意代码类别中实现了83.75%、19.38%和68.12%的攻击成功率。生成的提示成功地在如Cursor等实际AI开发工具中产生恶意代码,其输出经由领先的检测系统确认为恶意的比例超过73%。这些发现揭示了当前LLM实现中的重大安全漏洞,为改进代码生成应用中的AI安全对齐提供了宝贵见解。

关键词

引用

@article{arxiv.2512.21236,
  title  = {Casting a SPELL: Sentence Pairing Exploration for LLM Limitation-breaking},
  author = {Yifan Huang and Xiaojun Jia and Wenbo Guo and Yuqiang Sun and Yihao Huang and Chong Wang and Yang Liu},
  journal= {arXiv preprint arXiv:2512.21236},
  year   = {2025}
}

备注

Accepted to FSE 2026