中文

多小才算够?量化小型语言模型用于自动程序修复的实证证据

软件工程 2025-08-25 v1

摘要

背景:大型语言模型(LLM)极大地提升了自动程序修复(APR)方法的准确性。然而,LLM 受限于高计算资源需求。目标:我们聚焦于小型语言模型(SLM),其在与 LLM 相比计算资源有限的情况下仍表现良好。我们旨在评估 SLM 是否能在 APR 任务中取得具有竞争力的性能。方法:我们在 QuixBugs 基准测试上进行了实验,比较 SLM 和 LLM 的缺陷修复准确性。我们还分析了 int8 量化对 APR 性能的影响。结果:最新的 SLM 可以修复缺陷,其准确性与 LLM 相当甚至更高。此外,int8 量化对 APR 准确性的影响极小,同时显著降低了内存需求。结论:SLM 是 LLM 在 APR 中的可行替代方案,以较低的计算成本提供具有竞争力的准确性,且量化可以进一步提升其效率而不损害有效性。

关键词

引用

@article{arxiv.2508.16499,
  title  = {How Small is Enough? Empirical Evidence of Quantized Small Language Models for Automated Program Repair},
  author = {Kazuki Kusama and Honglin Shu and Masanari Kondo and Yasutaka Kamei},
  journal= {arXiv preprint arXiv:2508.16499},
  year   = {2025}
}