关于补丁正确性评估的可靠性
软件工程
2018-06-29 v2
摘要
当前最先进的自动软件修复(ASR)技术严重依赖不完整的规约(例如测试套件)来生成修复。然而,这可能使 ASR 工具生成不能泛化的不正确修复。为评估补丁正确性,研究人员一直分别遵循两种典型方式:(1)自动标注,其中补丁由独立测试套件(ITS)自动标记——通过 ITS 的补丁被视为正确或可泛化,否则为不正确;(2)作者标注,其中 ASR 技术的作者自行标注其及竞争工具生成的补丁的正确性标签。自动标注无法证明补丁实际正确,而作者标注易受主观性影响。这一担忧引发了关于评估近期提出的众多 ASR 技术有效性的恰当方式的持续争论。为解决此担忧,我们提出评估作者标注与自动标注在补丁正确性评估上的可靠性。为此,我们首先通过一项涉及 35 名专业开发人员作为独立标注者的用户研究,为 8 种最先进 ASR 技术生成的 189 个随机选定补丁构建正确性标签的黄金集。通过测量评分者间一致性作为标注质量的代理——如文献中常见做法——我们证明所构建的黄金集与其他高质量黄金集相当。随后我们将作者标注和自动标注生成的标签与该黄金集比较,以评估补丁评估方法的可靠性。我们接着报告若干发现并强调对未来研究的影响。
引用
@article{arxiv.1805.05983,
title = {On Reliability of Patch Correctness Assessment},
author = {Xuan Bach D. Le and Lingfeng Bao and David Lo and Xin Xia and Shanping Li},
journal= {arXiv preprint arXiv:1805.05983},
year = {2018}
}