中文

竞争编程 AI 的实证评估:以 AlphaCode 为例

软件工程 2022-08-29 v2

摘要

AlphaCode 是一个代码生成系统,用于协助软件开发人员利用自然语言问题描述解决竞争编程问题。尽管代码生成系统具有优势,开源社区对其实用性和数据许可表达了担忧。然而,目前尚无研究从代码克隆和性能角度考察生成的代码。在本文中,我们开展了一项实证研究,以发现 AlphaCode 生成的代码与人类代码之间的代码相似性和性能差异。结果表明:(i) AlphaCode 生成的代码与人类代码相似(即平均最大相似度得分为 0.56);(ii) 在执行时间和内存使用方面,生成的代码性能与人类代码相当或更差。此外,对于低难度问题,AlphaCode 倾向于生成与人类更相似的代码(即四个案例具有完全相同的代码)。根据我们的手动调查,对于高难度问题,它采用了过多的嵌套循环和不必要的变量声明,导致性能低下。复现包可在 https:/doi.org/10.5281/zenodo.6820681 获取。

关键词

引用

@article{arxiv.2208.08603,
  title  = {An Empirical Evaluation of Competitive Programming AI: A Case Study of AlphaCode},
  author = {Sila Lertbanjongngam and Bodin Chinthanet and Takashi Ishio and Raula Gaikovina Kula and Pattara Leelaprute and Bundit Manaskasemsak and Arnon Rungsawang and Kenichi Matsumoto},
  journal= {arXiv preprint arXiv:2208.08603},
  year   = {2022}
}

备注

Accepted to the 16th International Workshop on Software Clones (IWSC 2022)