中文

从偏差到改进提示:克隆检测模型偏差缓解的案例研究

软件工程 2025-05-12 v1

摘要

克隆代码问题在软件工程中持续存在,主要是因为开发人员经常复制粘贴代码片段。这种常见做法提高了克隆代码检测的重要性,吸引了软件工程研究人员和行业专业人士的关注。他们的共同关切源于克隆代码可能对软件质量产生的负面影响。强大的生成式大语言模型(LLM)的出现,例如ChatGPT,加剧了克隆代码问题。这些先进的模型拥有能够不恰当地创建代码克隆的生成能力。因此,检测克隆代码的需求比以往任何时候都更加关键。在本研究中,我们评估了LLMs用于克隆代码检测的适合性。我们的结果表明,Palm模型在avatar数据集上实现了89.30的高F1分数,在poolC数据集上实现了86.41的F1分数。LLMs的一个已知问题是容易受到提示偏差的影响,即这些模型的性能会根据提供的输入提示而有所波动。在我们的研究中,我们更深入地探讨了这些波动的原因,并提出了一种缓解克隆检测提示偏差的框架。我们的分析确定了八种不同的提示偏差类别,我们所制定的方法利用这些偏差可实现最高10.81%的F1分数提升。这些发现凸显了提示偏差对LLMs性能的重大影响,并突显了利用模型错误来缓解此类偏差的潜力。

关键词

引用

@article{arxiv.2505.05679,
  title  = {From Bias To Improved Prompts: A Case Study of Bias Mitigation of Clone Detection Models},
  author = {QiHong Chen and Lianghao Jiang and Iftekhar Ahmed},
  journal= {arXiv preprint arXiv:2505.05679},
  year   = {2025}
}