中文

代码重复对代码机器学习模型的不利影响

软件工程 2019-08-13 v6 机器学习

摘要

大数据代码(big code)领域依赖挖掘大型代码语料库来执行某些学习任务。Lopes 等人(2017)近期发现 GitHub 上存在大量近重复代码,这对此方法构成重大威胁。然而,设计源代码机器学习模型的研究者尚未注意到代码重复的影响。本工作中,我们探究代码重复对机器学习模型的影响,表明在重复代码语料库上测试时报告的性能指标有时比在去重语料库上高出至多 100%,而去重语料库更准确地代表了软件工程师如何使用代码机器学习模型。我们给出广泛使用数据集的重复指数,列举收集代码语料库及在其上评估机器学习模型的最佳实践。最后,我们发布工具以帮助社区在未来研究中避免此问题。

关键词

引用

@article{arxiv.1812.06469,
  title  = {The Adverse Effects of Code Duplication in Machine Learning Models of Code},
  author = {Miltiadis Allamanis},
  journal= {arXiv preprint arXiv:1812.06469},
  year   = {2019}
}

备注

Published in SPLASH Onward! 2019