中文

后门攻击神经代码搜索

软件工程 2023-06-13 v2 人工智能 计算与语言

摘要

从在线仓库复用现成代码片段是一种常见做法,可显著提升软件开发者的生产力。为寻找所需代码片段,开发者通过自然语言查询借助代码搜索引擎。神经代码搜索模型因而支撑着许多此类引擎。这些模型基于深度学习,并因其令人印象深刻的性能而受到大量关注。然而,这些模型的安全性方面很少被研究。特别地,攻击者可在神经代码搜索模型中注入后门,使其返回存在安全/隐私问题的有缺陷甚至易受攻击的代码。这可能影响下游软件(例如股票交易系统与自动驾驶)并造成财务损失和/或危及生命事件。在本文中,我们证明此类攻击是可行的且可相当隐蔽。通过仅修改一个变量/函数名,攻击者可使有缺陷/易受攻击的代码排在顶部 11%。我们的攻击 BADCODE 具有特殊的触发器生成与注入过程,使攻击更有效且更隐蔽。评估在两个神经代码搜索模型上进行,结果显示我们的攻击比基线高出 60%。我们的用户研究表明,基于 F1 分数,我们的攻击隐蔽性为基线的两倍。

关键词

引用

@article{arxiv.2305.17506,
  title  = {Backdooring Neural Code Search},
  author = {Weisong Sun and Yuchen Chen and Guanhong Tao and Chunrong Fang and Xiangyu Zhang and Quanjun Zhang and Bin Luo},
  journal= {arXiv preprint arXiv:2305.17506},
  year   = {2023}
}

备注

Accepted to the 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023)