代码评审预测模型中的团队相关特征
软件工程
2023-12-12 v1 机器学习
摘要
现代代码评审(Modern Code Review, MCR)是一种非正式的工具辅助质量保证实践。它依赖于代码变更作者与评审者(即提供反馈的开发者)之间的异步沟通。然而,在候选开发者中,某些人在特定情境下能比其他人提供更优质的反馈。因此,评审者的选择是一项重要任务,可受益于自动化支持。目前已提出许多方法,例如利用代码评审仓库数据来推荐评审者。本文提出利用团队相关特征来提升预测性能,从而辅助构建代码评审者推荐系统,我们的目标预测是识别将参与评审的评审者及其提供的反馈量。我们评估了这些与代码所有权、工作负载和团队关系相关的特征的预测能力。该评估通过仔细应对 MCR 领域带来的挑战(如数据集的时间特性和类别不平衡)来完成。此外,鉴于目前尚不清楚构建性能可接受的 MCR 预测模型需要多少历史数据,我们探索了用于构建预测模型的历史数据量。结果表明,单独来看,与代码所有权相关的特征具有最佳的预测能力。然而,基于特征选择,我们得出结论:所有提出的特征连同代码行数,能够对评审者参与度和反馈量做出最佳预测。关于历史数据量,使用 3、6、9 和 12 个月时间窗口的数据产生了相似的结果。因此,可以考虑较短的时间窗口来训练模型,从而降低计算成本,且对预测性能的影响可忽略不计……
引用
@article{arxiv.2312.06244,
title = {Team-related Features in Code Review Prediction Models},
author = {Eduardo Witter and Ingrid Nunes and Dietmar Jannach},
journal= {arXiv preprint arXiv:2312.06244},
year = {2023}
}