定位 CodeLLM 恶意输出
密码学与安全
2025-09-23 v1 计算与语言
机器学习
摘要
我们介绍 FreqRank,这是一种基于突变的防御方法,用于定位 LLM 输出及其对应的后门触发器中的恶意组件。FreqRank 假设恶意子字符串在触发输入的输出中一致出现,并使用基于频率的排序系统来识别它们。我们的排序系统随后利用这一知识来定位输入中存在的后门触发器。我们通过微调或自定义指令为三个下游任务创建了九个恶意模型,包括代码完成(CC)、代码生成(CG)和代码摘要(CS),并显示它们在攻击成功率(ASR)方面平均为 86.6%。此外,FreqRank 的排序系统在 98% 的情况下将恶意输出列为前五个建议之一。我们还展示了 FreqRank 的效果随突变数量的增加而扩大,并表明 FreqRank 即使在触发样本有限的情况下也能有效定位后门触发器。最后,我们显示该方法比其他防御方法高效 35-50%。
引用
@article{arxiv.2509.17070,
title = {Localizing Malicious Outputs from CodeLLM},
author = {Mayukh Borana and Junyi Liang and Sai Sathiesh Rajan and Sudipta Chattopadhyay},
journal= {arXiv preprint arXiv:2509.17070},
year = {2025}
}
备注
10 pages, 2 figures, 6 tables, Accepted at EMNLP 2025 Findings