中文

评估在双模态数据上微调对代码生成的影响

机器学习 2022-11-16 v1 人工智能 计算与语言 软件工程

摘要

尽管用于代码生成的语言模型日益流行,但在双模态编程论坛数据上训练如何影响模型的代码生成性能与可靠性仍属未知。为此,我们收集了超过 220 万条带答案的 StackOverflow 问题用于微调。这些微调后的模型在 HumanEval(Chen et al., 2021)和 Mostly Basic Program Problems(Austin et al., 2021)任务上的平均 pass@kpass@k 分别提升了 54.64% 和 85.35%。该训练方式进一步减少了带有语法错误和运行时错误的生成程序数量。然而,我们发现,在较高温度下,尽管 pass@kpass@k 分数更高,模型生成可运行程序的能力却显著下降,这凸显了需要更好的方法来融合此类数据以缓解这些副作用。代码见 https://github.com/gabeorlanski/bimodalcode-generation

关键词

引用

@article{arxiv.2211.07842,
  title  = {Evaluating How Fine-tuning on Bimodal Data Effects Code Generation},
  author = {Gabriel Orlanski and Seonhye Yang and Michael Healy},
  journal= {arXiv preprint arXiv:2211.07842},
  year   = {2022}
}

备注

4 pages, 4 figures