中文

DeepMutants:利用上下文变异训练神经缺陷检测器

软件工程 2021-07-15 v1 机器学习

摘要

基于学习的缺陷检测器有望通过利用变量与函数名或注释等自然线索,在大型代码库中发现缺陷。然而,现有技术在面对真实缺陷时往往表现不佳。我们认为,缺陷检测器学习目前受限于缺乏真实的有缺陷训练样本。事实上,真实世界中的缺陷十分稀缺,这导致现有方法不得不在人为构造且大多不真实的变异体上进行训练。本文提出一种新颖的上下文变异算子,它结合变异上下文知识,动态地向代码中注入自然且更真实的故障。我们的方法采用掩码语言模型,在可行的词元替换上生成依赖于上下文的分布。评估表明,从语言模型中采样不仅能产生更准确代表真实缺陷的变异体,还能在人工基准和真实世界源代码上均带来性能更优的缺陷检测器。

关键词

引用

@article{arxiv.2107.06657,
  title  = {DeepMutants: Training neural bug detectors with contextual mutations},
  author = {Cedric Richter and Heike Wehrheim},
  journal= {arXiv preprint arXiv:2107.06657},
  year   = {2021}
}

备注

12 pages, 10 figures