中文

敏捷工作量估算:我们是否已解决问题?来自第二项复制研究的洞察(GPT2SP 复制报告)

软件工程 2022-09-02 v1

摘要

Fu 和 Tantithamthavorn 最近提出了 GPT2SP,一种基于 Transformer 的用户故事 SP 估算深度学习模型。他们在 Choetkiertikul 等人共享的数据集上对其性能进行了实证评估,该数据集包含 16 个项目共 23,313 个 issue。他们以两个基线(即朴素的 Mean 和 Median 估算器)以及 Choetkiertikul 等人先前提出的方法(以下称 DL2SP)为基准,针对项目内与跨项目估算场景进行比对,并评估了 GPT2SP 各组件对 SP 估算准确性的贡献。其结果显示,GPT2SP 优于 DL2SP,在项目内场景下 MAE 提升 6%–47%,跨项目场景下提升 3%–46%。然而,当我们尝试使用 Fu 和 Tantithamthavorn 公开的 GPT2SP 源代码复现其实验时,发现平均绝对误差(MAE)计算中存在一个 bug,可能夸大了其工作中报告的 GPT2SP 准确性。因此我们提交了 pull request 修复该 bug,已被接受并合并至其仓库 https://github.com/awsm-research/gpt2sp/pull/2。在本报告中,我们描述了使用修复版 GPT2SP 复制原论文 RQ1 和 RQ2 实验所得的结果。遵循原研究,我们分析各估算方法在每个项目所有 issue 上的 Medan Absolute Error (MAE),但为完整起见也报告了 Median Absolute Error (MdAE) 和 Standard accuracy (SA)。

关键词

引用

@article{arxiv.2209.00437,
  title  = {Agile Effort Estimation: Have We Solved the Problem Yet? Insights From A Second Replication Study (GPT2SP Replication Report)},
  author = {Vali Tawosi and Rebecca Moussa and Federica Sarro},
  journal= {arXiv preprint arXiv:2209.00437},
  year   = {2022}
}

备注

Report