通过代码指标分析预测计算笔记本的可理解性
软件工程
2025-06-19 v2 人工智能
摘要
计算笔记本是数据科学家的主要编程工具,但其代码质量仍未得到充分研究,常常较差。鉴于可维护性和可重用性的重要性,提高代码可理解性至关重要。传统方法通常依赖有限的问卷或诸如点赞等元数据,这些元数据可能不反映实际代码清晰度。为此,我们提出一种新方法,利用来自软件存储库的用户意见来评估 Jupyter 笔记本的可理解性。我们对使用 DistilKaggle 数据集编译的 542,051 个 Kaggle Jupyter 笔记本进行了案例研究。为识别与代码可理解性相关的用户评论,我们使用微调的 DistilBERT 变换器。我们随后引入了新的度量指标,即基于相关评论数量、其点赞数和笔记本浏览量的用户意见代码可理解性(UOCU)。UOCU 的效果显著优于先前方法。我们进一步通过将 UOCU 与总点赞数结合构建了混合方法。使用改进后的度量指标,我们从 132,723 个最终笔记本中收集了 34 个笔记本级指标,并训练机器学习模型以预测可理解性。我们的顶级模型——随机森林分类器——在对笔记本代码可理解性水平进行分类时达到了 89% 的准确率。这一工作表明用户意见信号和笔记本指标在构建可扩展且准确的可理解性度量方面具有重要价值。
关键词
引用
@article{arxiv.2406.10989,
title = {Predicting the Understandability of Computational Notebooks through Code Metrics Analysis},
author = {Mojtaba Mostafavi Ghahfarokhi and Alireza Asadi and Arash Asgari and Bardia Mohammadi and Abbas Heydarnoori and Masih Beigi Rizi},
journal= {arXiv preprint arXiv:2406.10989},
year = {2025}
}