中文

HE-SNR: 通过熵揭示潜在逻辑以指导SWE-bench上的中期训练

机器学习 2026-05-29 v3 计算与语言 软件工程

摘要

SWE-bench已成为评估大语言模型在复杂软件工程任务上能力的主要基准。虽然这些能力主要是在中期训练阶段获得,并在随后的监督微调(SFT)阶段被激发,但在能够有效指导中期训练的指标方面仍然存在关键缺陷。诸如困惑度(PPL)之类的标准指标受到“长上下文代价”的影响,并且与下游SWE性能的相关性较弱。在本文中,我们首先引入了一种严格的数据过滤策略来弥补这一差距。至关重要的是,我们提出了熵压缩假说(Entropy Compression Hypothesis),将智能重新定义为不是标量Top-1压缩,而是将不确定性结构化为低阶的熵压缩状态(“合理犹豫”)的能力。基于这种细粒度的熵分析,我们制定了一个新的指标,HE-SNR(高熵信噪比)。我们在不同上下文窗口(32K/128K)下,对参数高达560B的模型验证了我们的方法。这项工作为优化LLM在复杂工程领域的潜在能力提供了理论基础和实用工具。

关键词

引用

@article{arxiv.2601.20255,
  title  = {HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench},
  author = {Yueyang Wang and Jiawei Fu and Baolong Bi and Xili Wang and Xiaoqing Liu},
  journal= {arXiv preprint arXiv:2601.20255},
  year   = {2026}
}

备注

Accepted at ICML 2026. 21 pages, 15 figures