中文

可读性的隐藏成本:代码格式如何悄然消耗您的 LLM 预算

软件工程 2025-08-21 v1 人工智能

摘要

源代码通常包含缩进和换行等元素,以提高人类开发者的可读性。然而,这些视觉辅助措施似乎对大型语言模型(LLM)并不像对人类开发者那样有益,因为代码被处理为线性的标记序列。此外,这些额外的标记会导致计算成本增加和响应时间延长。如果这些格式元素对 LLM 来说是非必需的,我们可以通过移除它们来降低此类成本。为弄清格式元素发挥的作用,我们进行了一项全面的实证研究,以评估代码格式对 LLM 性能和效率的影响。通过在 Java、Python、C++、C# 四种编程语言上进行大规模实验,涵盖十个 LLM(包括商业和开源模型),我们系统分析了在移除格式元素后,标记计数和性能的变化。关键发现表明,LLM 在格式化代码和非格式化代码之间可以保持性能,在输入标记方面平均降低 24.5%,而输出标记几乎没有降低。这使得代码格式移除成为一种实用的优化策略,用于提高 LLM 的效率。进一步的探索表明,无论是提示或微调 LLM,都可以显著减少(最高达 36.1%)的输出代码长度,而不会牺牲正确性。为便于实际应用,我们开发了一个双向代码转换工具,用于格式处理,可以无缝集成到现有的 LLM 推理工作流程中,确保人类可读性和 LLM 效率。

关键词

引用

@article{arxiv.2508.13666,
  title  = {The Hidden Cost of Readability: How Code Formatting Silently Consumes Your LLM Budget},
  author = {Dangfeng Pan and Zhensu Sun and Cenyuan Zhang and David Lo and Xiaoning Du},
  journal= {arXiv preprint arXiv:2508.13666},
  year   = {2025}
}

备注

Accepted by ICSE'26 (First Cycle)