Codex 攻破 HackerRank:记忆化问题及代码合成评估框架
软件工程
2022-12-07 v1 机器学习
摘要
Codex 模型已展现出从自然语言问题描述合成代码的卓越能力。然而,为揭示未知失败模式与隐藏偏差,此类大规模模型必须系统地接受多重且多样的评估研究。本工作中,我们基于来自流行竞赛编程门户 HackerRank 的 115 条 Python 问题陈述评估 Codex 模型的代码合成能力。我们的评估表明,Codex 确实精通 Python,在零样本设定下解决了 96% 的问题,在少样本设定下解决了 100% 的问题。然而,基于我们的评估,Codex 明显表现出生成记忆化代码的迹象。这令人警觉,尤其因为此类模型的采用与使用可能直接影响可预见未来中代码的编写与生成方式。鉴于此,我们进一步讨论并强调与源代码大规模模型相关的一些显著风险。最后,我们提出一种利用基于变异的问题陈述变体进行代码合成评估的框架。
引用
@article{arxiv.2212.02684,
title = {Codex Hacks HackerRank: Memorization Issues and a Framework for Code Synthesis Evaluation},
author = {Anjan Karmakar and Julian Aron Prenner and Marco D'Ambros and Romain Robbes},
journal= {arXiv preprint arXiv:2212.02684},
year = {2022}
}