FedCSD:一种基于联邦学习的代码异味检测方法
软件工程
2024-04-02 v3 人工智能
机器学习
摘要
本文提出一种联邦学习代码异味检测(FedCSD)方法,允许各组织在保护数据隐私的同时协作训练联邦机器学习模型。这些论断得到了三项实验的支持,实验显著利用了三个手动验证的数据集,旨在检测与考察不同的代码异味场景。实验1关注集中式训练实验,数据集二因异味较少取得了最低准确率(92.30%),而数据集一与三以微小差异取得了最高准确率(分别为98.90%与99.5%)。随后是关注交叉评估的实验2,其中每个机器学习模型使用一个数据集训练,再于另两个数据集上评估。该实验结果显示模型准确率显著下降(最低准确率:63.80%),此时训练数据集中异味较少,这对模型性能产生了明显影响(技术债务)。最后,第3个实验通过将数据集划分给10家公司来评估我们的方法。机器学习模型在公司本地训练,随后所有模型更新权重传至服务器。最终,经10家公司训练100轮的全局模型取得了98.34%的准确率。结果显示全局模型准确率与集中式模型最高准确率相比略有差异,但鉴于全局模型具备更全面的知识、更低的训练成本、数据隐私的保护以及技术债务问题的避免,该差异可忽略不计。
引用
@article{arxiv.2306.00038,
title = {FedCSD: A Federated Learning Based Approach for Code-Smell Detection},
author = {Sadi Alawadi and Khalid Alkharabsheh and Fahed Alkhabbas and Victor Kebande and Feras M. Awaysheh and Fabio Palomba and Mohammed Awad},
journal= {arXiv preprint arXiv:2306.00038},
year = {2024}
}
备注
17 pages, 7 figures, Journal paper