中文

超越BLEU:我们应如何评估代码生成模型的质量?

软件工程 2023-05-11 v2 机器学习

摘要

近年来,研究人员创建并引入了大量各类代码生成模型。由于对人类评估每个新模型版本不可行,社区采用自动评估指标如BLEU来近似人类判断的结果。这些指标源自机器翻译领域,且不清楚它们是否适用于代码生成任务以及它们在该任务上与人类评估的一致程度如何。也有其他为估计代码相似性而开发的指标,CodeBLEU和RUBY,其考虑了源代码的性质。然而,对于这些指标,几乎没有任何关于它们与人类评估一致性的研究。尽管如此,近期论文中指标分数的微小差异已被用来声称某些代码生成模型优于其他模型。本文中,我们提出一项关于六个指标——BLEU、ROUGE-L、METEOR、ChrF、CodeBLEU和RUBY——对于代码生成模型评估适用性的研究。我们在两个不同的代码生成数据集上进行研究,并使用人类标注者评估在这些数据集上运行的所有模型的质量。结果表明,对于Python单行代码的CoNaLa数据集,如果模型分数差异小于5分,没有任何指标能以>95%的确定性正确模拟人类关于哪个模型更优的判断。对于由特定结构类组成的HearthStone数据集,模型分数至少2分的差异足以声称一个模型优于另一个。我们的发现表明ChrF指标比常用的BLEU和CodeBLEU更适合代码生成模型的评估。然而,寻找一个与人类紧密一致的代码生成指标仍需额外工作。

关键词

引用

@article{arxiv.2208.03133,
  title  = {Out of the BLEU: how should we assess quality of the Code Generation models?},
  author = {Mikhail Evtikhiev and Egor Bogomolov and Yaroslav Sokolov and Timofey Bryksin},
  journal= {arXiv preprint arXiv:2208.03133},
  year   = {2023}
}