中文

顺序关乎!大语言模型在软件故障定位中的输入顺序偏差实证研究

软件工程 2025-09-30 v4 人工智能 机器学习

摘要

大语言模型 (LLM) 在软件工程任务(如故障定位 FL 和自动程序修复 APR)中显示出巨大的潜力。本研究探讨了输入顺序和上下文大小对 LLM 在 FL 性能的影响,这是许多下游软件工程任务的关键步骤。我们测试了不同的方法顺序,使用 Kendall Tau 距离,包括“完美”顺序(即真实答案在前)和“最差”顺序(即真实答案在后),使用两个由 Java 和 Python 项目组成的基准测试。我们的结果表明,顺序存在显著偏差;在 Java 项目中,Top-1 FL 准确率从 57% 下降到 20%,而在 Python 项目中,准确率从 38% 下降到约 3%。将输入分解为更小的上下文有助于减少这种偏差,将 FL 中的性能差距从 22% 缩小到 6%,再缩小到仅 1%。我们随后调查了这种顺序偏差是否由数据泄露导致,通过用更有意义的替代名称重新命名方法名称。我们的发现表明,趋势仍然持续,这表明偏差并非由数据泄露引起。我们还考察了基于传统 FL 技术和指标的排序方法。基于 DepGraph 的排序可实现 48% 的 Top-1 准确率,这优于基于 CallGraphDFS 的更直接排序方法。这些发现凸显了在 FL 以及其他软件工程任务中如何构建输入、管理上下文和选择排序方法的重要性。

关键词

引用

@article{arxiv.2412.18750,
  title  = {Order Matters! An Empirical Study on Large Language Models' Input Order Bias in Software Fault Localization},
  author = {Md Nakhla Rafi and Dong Jae Kim and Tse-Hsun Chen and Shaowei Wang},
  journal= {arXiv preprint arXiv:2412.18750},
  year   = {2025}
}