中文

对齐代码生成模型的离线指标与人类价值评判

软件工程 2023-06-14 v2 人工智能 人机交互 编程语言

摘要

大语言模型已展现出辅助程序员生成代码的巨大潜力。对于此类人—AI结对编程场景,我们经实证表明,尽管生成代码最常按其功能正确性(即生成代码是否通过可用单元测试)来评估,但正确性并未完全捕捉(例如可能低估)这些模型所能提供的生产力增益。通过一项有N = 49名经验丰富程序员参与的用户研究,我们表明,虽然正确性捕捉了高价值生成,程序员仍会将未通过单元测试但能减少完成编码任务总体工作量的代码评为有价值。最后,我们提出一种结合功能正确性与句法相似度的混合指标,并表明其与价值的相关系数提高了14%,从而能在评估和比较模型时更好地代表现实世界增益。

关键词

引用

@article{arxiv.2210.16494,
  title  = {Aligning Offline Metrics and Human Judgments of Value for Code Generation Models},
  author = {Victor Dibia and Adam Fourney and Gagan Bansal and Forough Poursabzi-Sangdeh and Han Liu and Saleema Amershi},
  journal= {arXiv preprint arXiv:2210.16494},
  year   = {2023}
}

备注

Accepted at ACL 2023 (Findings)