基于结构熵衡量 LLM 代码生成稳定性
软件工程
2025-08-21 v1 计算与语言
摘要
评估来自大型语言模型(LLM)的代码生成稳定性,对于判断其在实际开发中的可靠性至关重要。我们将已有的"结构熵概念"扩展到程序领域,通过将熵与抽象语法树(AST)分析相结合。对于任意固定提示,我们收集每个生成程序中深度受限子树的多重集,并将其相对频率视为概率分布。随后,我们以两种互补的方式衡量稳定性:(i) Jensen-Shannon 散度,一种对称且有界的结构重叠指示器;(ii)结构交叉熵比率,凸显缺失的高概率模式。两种指标均支持仅结构和token感知两种变体,使我们能够分别观察控制流形状和标识符层面的可变性。与 pass@k、BLEU 或 CodeBLEU 不同,我们的指标无需参考、语言无关且与执行无关。我们在标准代码生成任务上对几款领先 LLM 进行基准测试,证明 AST 驱动的结构熵揭示了模型一致性和鲁棒性的细微差别。该方法以 的时间复杂度运行,无需外部测试,为代码生成评估工具包提供了轻量级的新增功能。
引用
@article{arxiv.2508.14288,
title = {Measuring LLM Code Generation Stability via Structural Entropy},
author = {Yewei Song and Tiezhu Sun and Xunzhu Tang and Prateek Rajput and Tegawende F. Bissyande and Jacques Klein},
journal= {arXiv preprint arXiv:2508.14288},
year = {2025}
}
备注
ASE-NIER