中文

Evaluate-and-Purify:面对对抗性攻击的 LLM 评估与净化

软件工程 2025-04-29 v1 计算与语言

摘要

代码语言模型在软件工程任务中的广泛采用暴露了面对对抗性攻击的脆弱性,尤其是标识符替换攻击。尽管现有的标识符替换攻击者表现出高成功率,但常常产生不自然的代码模式的对抗样本。本文系统评估了对抗样本质量,采用 LLM 作为评判器。我们的分析显示,超过 80% 的由最先进的标识符替换攻击者(如 ALERT)生成的对抗样本实际上是可被检测的。基于这一洞察,我们提出了 EP-Shield—a 一个通过自然性感知推理评估和净化标识符替换攻击的统一框架。具体而言,我们首先评估代码的自然性并识别被扰动的对抗代码,然后对其进行净化,使受害模型能够恢复正确的预测。大量实验表明,EP-Shield 在对抗微调方面优异(最高可达 83.36% 的改进),其轻量级设计(7B 参数)可达 GPT-4 水平。

关键词

引用

@article{arxiv.2504.19730,
  title  = {Evaluate-and-Purify: Fortifying Code Language Models Against Adversarial Attacks Using LLM-as-a-Judge},
  author = {Wenhan Mu and Ling Xu and Shuren Pei and Le Mi and Huichi Zhou},
  journal= {arXiv preprint arXiv:2504.19730},
  year   = {2025}
}

备注

25 pages, 6 figures