中文

代码模型中的中毒源代码检测

密码学与安全 2025-03-18 v2 机器学习

摘要

深度学习模型在执行涉及源代码的各类任务中日益普及。然而,其黑盒特性引发了对潜在风险的担忧。中毒攻击便是此类风险之一,攻击者故意用恶意样本污染训练集,以在特定场景下误导模型的预测。为保护源代码模型免受中毒攻击,我们提出了 CodeGarrison (CG),这是一种依赖代码嵌入来识别中毒代码样本的混合深度学习模型。我们针对最先进的检测技术 ONION 评估了 CG,检测对象为由 DAMP、MHM、ALERT 以及一种名为 CodeFooler 的新型中毒技术生成的中毒样本。结果表明,CG 以 93.5% 的准确率显著优于 ONION。我们还测试了 CG 对未知攻击的鲁棒性,在上述四种攻击中识别中毒样本的平均准确率达到 85.6%。

关键词

引用

@article{arxiv.2502.13459,
  title  = {Poisoned Source Code Detection in Code Models},
  author = {Ehab Ghannoum and Mohammad Ghafari},
  journal= {arXiv preprint arXiv:2502.13459},
  year   = {2025}
}