代码大语言模型软件设计能力的层次化评估
软件工程
2025-12-30 v2
摘要
大语言模型(LLMs)在软件工程领域正得到日益广泛的应用,然而它们对核心软件设计概念的掌握是否稳健仍不明确。我们进行了一项实证研究,系统地评估了它们对内聚(模块内)和耦合(模块间)的理解。我们通过程序化方式生成设计不佳的代码片段,并在不同引导水平下测试 DeepSeek-R1 模型家族(14B、32B、70B),从简单的“验证”到“引导式”再到“开放式生成”,同时通过注入干扰元素来改变上下文噪声。虽然在理想条件下,模型对这两个概念都表现出扎实的基线理解,但它们的实践知识是脆弱且高度不对称的。关于耦合的推理被证明是脆弱的;在嘈杂、开放式的场景中,性能急剧下降,F1 分数下降超过 50%。相比之下,模型对内聚的分析在有引导任务中对内部噪声表现出显著的鲁棒性,几乎没有性能下降。然而,当所有引导被移除时,这种韧性也会失效。推理轨迹分析证实了这些失败模式,揭示了对耦合的“认知捷径”与对内聚的更详尽(但仍失败)的分析。总而言之,虽然大语言模型可以为识别设计缺陷提供可靠的辅助,但它们在嘈杂、现实的语境中进行自主推理的能力是有限的,这凸显了对更具可扩展性和鲁棒性的程序理解能力的迫切需求。
引用
@article{arxiv.2511.20933,
title = {Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code},
author = {Mootez Saad and Boqi Chen and José Antonio Hernández López and Dániel Varró and Tushar Sharma},
journal= {arXiv preprint arXiv:2511.20933},
year = {2025}
}
备注
18 figures