机器编程系统是否使用了正确的源代码度量来筛选代码仓库?
软件工程
2022-09-27 v1 人工智能
机器学习
摘要
机器编程 (MP) 是确定性与概率计算交叉处的新兴领域,旨在协助软件与硬件工程师等应用。除强大计算资源外,MP 系统常依赖大量开源代码以学习代码与编程的有趣属性,并解决调试、代码推荐、自动补全等领域的问题。遗憾的是,若干现有 MP 系统要么不考虑代码仓库质量,要么使用不同于软件工程界通常所用的非典型质量度量来筛选它们。因此,代码仓库质量对这些系统性能的影响有待研究。在这篇初步论文中,我们评估了不同质量仓库对候选 MP 系统性能的影响。为此,我们开发了一个名为 GitRank 的框架,利用该主题的现有研究,按质量、可维护性与流行度对开源仓库排序。我们随后应用 GitRank 评估候选 MP 系统所用质量度量与我们的框架所用质量度量之间的相关性。我们的初步结果显示 GitRank 所用质量度量与 ControlFlag 性能间存在一定相关性,表明 GitRank 中的部分度量适用于 ControlFlag。但这也引发关于 MP 系统所用代码仓库正确质量度量的疑问。我们相信我们的发现也为影响 MP 系统性能的代码质量度量提供了有趣的见解。
引用
@article{arxiv.2209.11946,
title = {Are Machine Programming Systems using Right Source-Code Measures to Select Code Repositories?},
author = {Niranjan Hasabnis},
journal= {arXiv preprint arXiv:2209.11946},
year = {2022}
}
备注
6 pages, 1 figure, to be presented at MaLTeSQuE 2022 workshop to be held with ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (ESEC-FSE) 2022, November 18, Singapore,