AI 模型是否梦想着更快的代码?一项关于 LLM 在真实软件中提出性能改进的实证研究
软件工程
2026-04-10 v2 人工智能
性能
摘要
大语言模型(LLMs)能够生成代码,但它们能否为复杂、真实的软件系统生成高性能代码?在本研究中,我们使用从性能关键的开源 Java 项目中挖掘出的 65 个任务的数据集来探讨这一问题。与以往聚焦于算法谜题的研究不同,我们在真实的性能敏感型生产代码上开展实验,并采用开发者编写的 JMH 基准测试,严格地针对人类基线验证性能提升。我们的结果揭示了一个复杂的现实——尽管 LLM 在解决这些复杂工程问题方面展现出令人惊讶的强大能力,但其解决方案存在极大的波动性,且平均而言仍落后于人类开发者。因此,我们发现当前基于算法任务的基准测试对 LLM 能力的评估过于乐观。我们将这一现实世界中的性能差距归因于两个主要局限:其一,LLM 难以自主定位性能热点;其二,即便获得明确指导,它们也常常无法合成最优的算法改进。我们的研究结果凸显了从静态代码生成迈向更复杂的、能够对运行时行为进行剖析与观测的智能体系统的必要性。
引用
@article{arxiv.2510.15494,
title = {Do AI Models Dream of Faster Code? An Empirical Study on LLM-Proposed Performance Improvements in Real-World Software},
author = {Lirong Yi and Gregory Gay and Philipp Leitner},
journal= {arXiv preprint arXiv:2510.15494},
year = {2026}
}