面向 Stack Overflow 的预测分析:为 collaborator 提供答案、代码质量和退出预测
软件工程
2025-06-24 v1
摘要
以往使用 Stack Overflow 数据开发预测模型的研究通常仅采用 3-5 个基准模型或采用任意选择方法。尽管这些研究具有启发性,但其有限的范围表明需要对更多模型进行基准测试,以避免忽略未测试的算法。我们的研究在三个任务上评估了 21 种算法:预测用户可能回答的问题数量、其代码质量违规情况以及其退出状态。我们采用了标准化、标准化,以及对数和幂转换,配合贝叶斯超参数优化和遗传算法。CodeBERT 是一种用于自然语言和编程语言的预训练语言模型,被微调以对用户的帖子(问题和答案)和代码片段进行分类,以预测用户退出。我们发现,结合标准化的 Bagging 集成模型在预测用户答案数量方面取得最高的 R2 值 (0.821)。随后,随机梯度下降回归器、Bagging 和 Epsilon 支持向量机模型在预测用户代码质量方面始终优于其他基准算法。Extreme Gradient Boosting 搭配对数转换在预测用户退出方面取得最高的 F1 分数 (0.825)。CodeBERT 能够以最终 F1 分数 0.809 对用户退出进行分类,验证了仅基于数值数据即可获得 Extreme Gradient Boosting 性能。总体而言,我们对 21 种算法的基准测试提供了多个见解。研究人员可以利用关于特定目标变量最合适模型的发现,以及实践者可以利用识别出的最优超参数来减少他们自己的超参数调优过程中初始搜索空间。
关键词
引用
@article{arxiv.2506.18329,
title = {Predictive Analytics for Collaborators Answers, Code Quality, and Dropout on Stack Overflow},
author = {Elijah Zolduoarrati and Sherlock A. Licorish and Nigel Stanger},
journal= {arXiv preprint arXiv:2506.18329},
year = {2025}
}
备注
46 pages, 17 tables, 7 figures