中文

评估神经测试预言生成中的评价指标

计算与语言 2024-11-07 v1 软件工程

摘要

在这项工作中,我们重新审视已有的预言(oracle)生成研究以及 ChatGPT,通过实证考察它们在基于 NLG 的指标和测试充分性指标两方面的当前性能表现。具体而言,我们在五个基于 NLG 的指标和两个测试充分性指标上训练并运行了四个最先进的测试预言生成模型以进行分析。我们对这两组不同指标施加了两种不同的相关性分析。令人惊讶的是,我们发现基于 NLG 的指标与测试充分性指标之间不存在显著相关性。例如,在 activemq-artemis 项目上,ChatGPT 生成的预言在所有被研究的 NOG 中于所有基于 NLG 的指标上取得了最高性能,然而,与所有被研究的 NOG 相比,它在使测试充分性指标下降的项目数量上最多。我们进一步进行定性分析以探究观察结果背后的原因,发现具有高基于 NLG 指标但低测试充分性指标的预言往往在其参数中包含复杂或多次链式的方法调用,使得模型难以完整生成,从而影响测试充分性指标。另一方面,具有低基于 NLG 指标但高测试充分性指标的预言往往需调用不同的断言类型或与真值中功能相似的不同方法。总体而言,本工作以基于 NLG 和测试充分性指标的广泛性能评估补充了先前关于测试预言生成的研究,并为未来更好地评估深度学习在软件测试生成中的应用提供了指导。

关键词

引用

@article{arxiv.2310.07856,
  title  = {Assessing Evaluation Metrics for Neural Test Oracle Generation},
  author = {Jiho Shin and Hadi Hemmati and Moshi Wei and Song Wang},
  journal= {arXiv preprint arXiv:2310.07856},
  year   = {2024}
}

备注

10 pages + reference