中文

LONGCODEU:长代码理解基准测试

软件工程 2025-03-07 v1

摘要

当前先进的长上下文语言模型在实际软件工程应用中具有巨大潜力。然而,该领域的进展仍受到一个根本性限制的制约:缺乏针对长代码理解的严谨评估框架。为弥合这一差距,我们提出了由四个维度(8个任务)构成的长代码理解基准测试 LONGCODEU,用于评估 LCLMs 在实际应用中所需的长代码理解能力,包括代码单元感知、代码单元内部理解、代码单元间关系理解以及长代码文档理解。我们在 LONGCODEU 上评估了 9 个流行的 LCLMs(即 6 个通用模型和 3 个代码模型)。我们的实验结果揭示了当前 LCLMs 在长代码理解方面的关键局限性。特别是,当长代码长度超过 32K 时,LCLMs 的性能会急剧下降,远远落后于其声称的 128K-1M 上下文窗口。在四个方面中,代码单元间关系理解是 LCLMs 最具挑战性的任务。我们的研究为优化 LCLMs 和推动软件工程领域的发展提供了宝贵的见解。

关键词

引用

@article{arxiv.2503.04359,
  title  = {LONGCODEU: Benchmarking Long-Context Language Models on Long Code Understanding},
  author = {Jia Li and Xuyuan Guo and Lei Li and Kechi Zhang and Ge Li and Jia Li and Zhengwei Tao and Fang Liu and Chongyang Tao and Yuqi Zhu and Zhi Jin},
  journal= {arXiv preprint arXiv:2503.04359},
  year   = {2025}
}

备注

18 pages