面向 Issue 与 Commit 的链接预测模型数据泄漏与泛化性实证研究
软件工程
2023-04-25 v2 机器学习
摘要
为了改进文档记录与维护实践,开发者通常手动在相关软件制品之间建立链接。实证研究表明,开发者经常忽视这一实践,导致显著的信息丢失。为解决此问题,已提出自动链接恢复技术。然而,这些方法主要关注在随机划分数据集上提升预测准确率,较少关注数据泄漏的影响以及预测模型的泛化性。LinkFormer 旨在解决这些局限。我们的方法不仅保持并提升了现有预测的准确率,还增强了其与真实场景的契合度及泛化能力。首先,为更好地利用上下文信息进行预测,我们采用 Transformer 架构,并在 issue 与 commit 的文本及元数据信息上微调多个预训练模型。接着,为衡量时间对模型性能的影响,我们在训练与测试阶段采用两种划分策略:随机划分与时间划分数据集。最后,为追求能在一系列项目上展现高性能的通用模型,我们在两种不同迁移学习设定下对 LinkFormer 进行额外微调。我们的发现表明,为有效模拟真实场景,研究者在训练模型时必须保持数据的时间流向。此外,结果表明 LinkFormer 以显著优势超越现有方法,在项目内设定下 F1-measure 提升 48%。最后,LinkFormer 在跨项目设定下的性能与其在项目内场景下的平均性能相当。
引用
@article{arxiv.2211.00381,
title = {An Empirical Study on Data Leakage and Generalizability of Link Prediction Models for Issues and Commits},
author = {Maliheh Izadi and Pooya Rostami Mazrae and Tom Mens and Arie van Deursen},
journal= {arXiv preprint arXiv:2211.00381},
year = {2023}
}