中文

MT4DP: 基于变形测试的DL-based代码搜索模型数据投毒攻击检测

软件工程 2025-07-16 v1

摘要

最近的几项研究表明,数据投毒攻击对基于深度学习的(DL-based)代码搜索模型构成严重的安全威胁。攻击者会向训练数据中注入精心设计的恶意模式,误导代码搜索模型在训练期间学习这些模式。在使用受投毒的代码搜索模型进行推理时,一旦触发恶意模式,模型倾向于将恶意代码排序放在更高的位置。然而,现有的DL-based代码搜索模型数据投毒攻击检测方法仍显得不够有效。为解决这一关键安全问题,我们提出MT4DP——一种DL-based代码搜索模型的数据投毒攻击检测框架,通过变形测试实现。MT4DP引入一种新颖的语义等价变形关系(SE-MR),用于检测DL-based代码搜索模型的数据投毒攻击。具体而言,MT4DP首先从搜索查询中识别高频词作为潜在的投毒目标,并将其对应的查询作为源查询。对于每个源查询,MT4DP生成两个语义等价的后续查询并检索其源排序列表。然后,对每个源排序列表根据其代码片段与后续查询之间的语义相似性进行重新排序。最后,计算源列表和重新排序列表之间的差异,以揭示SE-MR的违规并警报数据投毒攻击。实验结果表明,MT4DP在DL-based代码搜索模型的数据投毒攻击检测方面显著提升了性能,平均F1分数提高了191%,平均精确率提高了265%。我们的工作旨在促进针对DL-based代码搜索模型的有效数据投毒威胁缓解技术的进一步研究。

关键词

引用

@article{arxiv.2507.11092,
  title  = {MT4DP: Data Poisoning Attack Detection for DL-based Code Search Models via Metamorphic Testing},
  author = {Gong Chen and Wenjie Liu and Xiaoyuan Xie and Xunzhu Tang and Tegawendé F. Bissyandé and Songqiang Chen},
  journal= {arXiv preprint arXiv:2507.11092},
  year   = {2025}
}

备注

27 pages