面向 Bug 严重性预测的隐私保护方法
软件工程
2025-07-01 v1
摘要
Bug 严重性预测是软件工程中的关键任务,可实现更高效的资源分配和软件维护优先级。尽管 AI 分析和模型显著需要大量数据集的访问,但工业应用面临数据共享限制和标注数据稀缺的挑战。本研究使用源代码指标和大语言模型(LLM)针对方法级 Bug 严重性进行预测,评估了两个广泛使用的数据集。我们比较了基于集中式学习、联邦学习和合成数据生成训练的模型性能。实验结果表明,使用联邦学习和合成数据训练的模型在不进行数据共享的情况下,能够达到集中式训练模型的 comparable 效果。我们的发现凸显了联邦学习和合成数据生成等隐私保护方法在数据共享是主要挑战的工业环境中,能够实现有效的 Bug 严重性预测的潜力。源代码和数据集已提供于我们的 GitHub 仓库:https://github.com/drvshavva/EASE2025-Privacy-Preserving-Methods-for-Bug-Severity-Prediction。
引用
@article{arxiv.2506.22752,
title = {Privacy-Preserving Methods for Bug Severity Prediction},
author = {Havvanur Dervişoğlu and Ruşen Halepmollası and Elif Eyvaz},
journal= {arXiv preprint arXiv:2506.22752},
year = {2025}
}