揭示大语言模型在生成语义与跨语言克隆代码中的潜力
软件工程
2023-09-13 v1 人工智能
机器学习
摘要
语义与跨语言代码克隆生成可用于代码复用、代码理解、重构与基准测试。OpenAI 的 GPT 模型因用于文本生成,在此类克隆生成中具有潜力。当开发者从 Stack Overflow (SO) 或系统内部复制/粘贴代码时,可能出现不一致修改导致意外行为。类似地,若某人拥有某一特定编程语言的代码片段但寻求不同语言中的等效功能,语义跨语言代码克隆生成方法可提供有价值的帮助。本研究中,我们以 SemanticCloneBench 为工具,评估 GPT-3 模型在给定片段下生成语义与跨语言克隆变体的能力。我们汇集了一组多样化的代码片段,并评估了 GPT-3 生成代码变体的表现。通过大量实验与分析(9 名评审员耗时 158 小时进行验证),我们考察了该模型生成准确且语义正确变体的能力。我们的发现揭示了 GPT-3 在代码生成中的优势,为软件开发中先进语言模型的潜在应用与挑战提供了见解。定量分析结果引人注目:在语义克隆领域,GPT-3 通过少样本提示工程取得 62.14% 的准确率与 0.55 的 BLEU 分数;此外,该模型在跨越语言边界方面表现突出,生成跨语言克隆的准确率高达 91.25%。
引用
@article{arxiv.2309.06424,
title = {Unveiling the potential of large language models in generating semantic and cross-language clones},
author = {Palash R. Roy and Ajmain I. Alam and Farouq Al-omari and Banani Roy and Chanchal K. Roy and Kevin A. Schneider},
journal= {arXiv preprint arXiv:2309.06424},
year = {2023}
}
备注
Accepted in IWSC