中文

基于结构熵衡量 LLM 代码生成稳定性

软件工程 2025-08-21 v1 计算与语言

摘要

评估来自大型语言模型(LLM)的代码生成稳定性,对于判断其在实际开发中的可靠性至关重要。我们将已有的"结构熵概念"扩展到程序领域,通过将熵与抽象语法树(AST)分析相结合。对于任意固定提示,我们收集每个生成程序中深度受限子树的多重集,并将其相对频率视为概率分布。随后,我们以两种互补的方式衡量稳定性:(i) Jensen-Shannon 散度,一种对称且有界的结构重叠指示器;(ii)结构交叉熵比率,凸显缺失的高概率模式。两种指标均支持仅结构和token感知两种变体,使我们能够分别观察控制流形状和标识符层面的可变性。与 pass@k、BLEU 或 CodeBLEU 不同,我们的指标无需参考、语言无关且与执行无关。我们在标准代码生成任务上对几款领先 LLM 进行基准测试,证明 AST 驱动的结构熵揭示了模型一致性和鲁棒性的细微差别。该方法以 O(n,d)O(n,d) 的时间复杂度运行,无需外部测试,为代码生成评估工具包提供了轻量级的新增功能。

引用

@article{arxiv.2508.14288,
  title  = {Measuring LLM Code Generation Stability via Structural Entropy},
  author = {Yewei Song and Tiezhu Sun and Xunzhu Tang and Prateek Rajput and Tegawende F. Bissyande and Jacques Klein},
  journal= {arXiv preprint arXiv:2508.14288},
  year   = {2025}
}

备注

ASE-NIER