面向真实评估的提交信息生成:匹配线上与线下环境
软件工程
2025-01-09 v2 人机交互
机器学习
摘要
当 Commit Message Generation (CMG) 系统集成到 JetBrains 的 IDE 和其他产品时,我们基于用户对生成信息的接受度进行在线评估。然而,对 CMG 系统的每一次变更进行在线实验都比较麻烦,因为每次迭代都会影响用户并需要时间收集足够的统计数据。另一方面,研究文献中流行的离线评估方法便于快速实验,但采用的自动度量指标无法保证代表真实用户的偏好。本文描述了我们在 JetBrains 所采用的一种新方法,利用在线度量指标——用户在提交生成信息到 VCS 之前会进行的编辑次数——来选择离线实验的度量指标。为支持这种新类型的评估,我们开发了一种模拟实际工作流程的 CMG 系统的新型标注收集工具,收集了 57 组由 GPT-4 生成的提交信息与由专家编辑的对应版本的数据集,并设计并验证了如何对此数据集进行合成扩展的方法。随后,我们使用最终的 656 组数据集研究了常见相似度度量指标与反映真实用户体验的在线度量指标之间的相关性。我们的结果表明,编辑距离与在线度量指标相关性最高,而常见的相似度度量指标如 BLEU 和 METEOR 表现出低相关性。这与之前关于 CMG 相似度度量指标的研究结果相矛盾,表明用户与 CMG 系统的真实世界交互与受控环境中人类标注者的响应存在显著差异。我们发布了所有代码和数据集以支持该领域的后续研究:https://jb.gg/cmg-evaluation。
引用
@article{arxiv.2410.12046,
title = {Towards Realistic Evaluation of Commit Message Generation by Matching Online and Offline Settings},
author = {Petr Tsvetkov and Aleksandra Eliseeva and Danny Dig and Alexander Bezzubov and Yaroslav Golubev and Timofey Bryksin and Yaroslav Zharov},
journal= {arXiv preprint arXiv:2410.12046},
year = {2025}
}
备注
10 pages, 5 figures (Published at ICSE'2025)