竞争编程 AI 的实证评估:以 AlphaCode 为例
软件工程
2022-08-29 v2
摘要
AlphaCode 是一个代码生成系统,用于协助软件开发人员利用自然语言问题描述解决竞争编程问题。尽管代码生成系统具有优势,开源社区对其实用性和数据许可表达了担忧。然而,目前尚无研究从代码克隆和性能角度考察生成的代码。在本文中,我们开展了一项实证研究,以发现 AlphaCode 生成的代码与人类代码之间的代码相似性和性能差异。结果表明:(i) AlphaCode 生成的代码与人类代码相似(即平均最大相似度得分为 0.56);(ii) 在执行时间和内存使用方面,生成的代码性能与人类代码相当或更差。此外,对于低难度问题,AlphaCode 倾向于生成与人类更相似的代码(即四个案例具有完全相同的代码)。根据我们的手动调查,对于高难度问题,它采用了过多的嵌套循环和不必要的变量声明,导致性能低下。复现包可在 https:/doi.org/10.5281/zenodo.6820681 获取。
引用
@article{arxiv.2208.08603,
title = {An Empirical Evaluation of Competitive Programming AI: A Case Study of AlphaCode},
author = {Sila Lertbanjongngam and Bodin Chinthanet and Takashi Ishio and Raula Gaikovina Kula and Pattara Leelaprute and Bundit Manaskasemsak and Arnon Rungsawang and Kenichi Matsumoto},
journal= {arXiv preprint arXiv:2208.08603},
year = {2022}
}
备注
Accepted to the 16th International Workshop on Software Clones (IWSC 2022)