代码模型中的中毒源代码检测
密码学与安全
2025-03-18 v2 机器学习
摘要
深度学习模型在执行涉及源代码的各类任务中日益普及。然而,其黑盒特性引发了对潜在风险的担忧。中毒攻击便是此类风险之一,攻击者故意用恶意样本污染训练集,以在特定场景下误导模型的预测。为保护源代码模型免受中毒攻击,我们提出了 CodeGarrison (CG),这是一种依赖代码嵌入来识别中毒代码样本的混合深度学习模型。我们针对最先进的检测技术 ONION 评估了 CG,检测对象为由 DAMP、MHM、ALERT 以及一种名为 CodeFooler 的新型中毒技术生成的中毒样本。结果表明,CG 以 93.5% 的准确率显著优于 ONION。我们还测试了 CG 对未知攻击的鲁棒性,在上述四种攻击中识别中毒样本的平均准确率达到 85.6%。
引用
@article{arxiv.2502.13459,
title = {Poisoned Source Code Detection in Code Models},
author = {Ehab Ghannoum and Mohammad Ghafari},
journal= {arXiv preprint arXiv:2502.13459},
year = {2025}
}