中文

中等力量: 内部软件指标在应用发布时预测流行度有多大作用?

软件工程 2025-09-15 v3

摘要

在竞争激烈的市场中预测移动应用在首次发布前的流行度可以为开发人员提供战略优势,但仍是一个具有挑战性的问题。本研究探讨了在部署前,从源代码中可测量的内部软件指标有多大程度上可以预测应用在初期的流行度(即每年的评级和下载次数)。对于我们的分析,我们构建了一个严格筛选后的 446 个开源 Java 开发的 Android 应用数据集,这些应用在 F-Droid 和 Google Play Store 都可用。我们使用来自 F-Droid 的应用源代码提取了广泛的内部指标,包括系统级、类级和方法级的代码指标、代码异味以及应用元数据。收集来自 Play 商店的流行度相关信息,包括评论和下载次数。我们评估了回归和分类模型,涵盖三个特征集:一个仅包含大小的最小基线、一个基于领域知识挑选的 Handpicked 集,以及通过特征选择算法派生的 Voting 集。我们的结果表明,对于应用评级和下载次数,回归模型表现不佳,这是由于评级分布不均且我们数据集中下载次数范围高度分散所致。然而, 当重新定义为二元分类(流行 vs. 不流行)时,性能显著提升——最佳模型,即多层感知器, achieves an F1-score of 0.72。我们得出结论,尽管仅凭内部代码指标不足以准确预测应用未来的流行度,但它们确实与之 exhibit meaningful correlations with it. 因此,我们的发现挑战了先前那些完全否定内部指标作为软件质量有效指示器的研究。相反,我们的结果与表明内部代码指标在恰当的上下文中具有价值的研究相吻合——具体而言,我们发现它们在分类任务中具有用途。

关键词

引用

@article{arxiv.2507.02110,
  title  = {Moderately Mighty: To What Extent Can Internal Software Metrics Predict App Popularity at Launch?},
  author = {Md Nahidul Islam Opu and Fatima Islam Mouri and Rick Kazman and Yuanfang Cai and Shaiful Chowdhury},
  journal= {arXiv preprint arXiv:2507.02110},
  year   = {2025}
}