中文

Soundness-Aware Level:一种预测大语言模型推理潜力的微观特征

机器学习 2025-10-22 v2 计算与语言

摘要

利用可验证奖励进行强化学习(RLVR)可激发大语言模型(LLM)的强大推理能力,但不同基础模型在 RLVR 后的表现差异显著。这引出一个根本性问题:预训练模型的何种微观特性导致这种差异?为调查此问题,我们将推理形式化为由从 LLM 潜空间通过跨层稀疏自编码器(SAE)提取的特征构建的 Horn 子句链(“若-则”规则)。我们估计这些特征之间的转移概率,并进一步按其语义可靠性水平(如严格、合理、噪声)对每条规则进行分类。我们的关键发现是,高潜力模型本质上是 soundness-aware 的:其内部概率分布在不同可靠性水平的规则之间系统性地发生偏移,对于“严格”规则与“噪声”规则变得高度区分。相比之下,较弱的模型则是 soundness-agnostic 的,无论可靠性水平如何,都坍缩为单一分布。为量化此现象,我们引入 Soundness-Aware Level(SAL),一种基于 Jensen-Shannon 散度测度分布分离程度的微观指标。我们表明,SAL 对后续 RLVR 推理性能的预测遵循精确的经验法则(R^2=0.87),且适用于 diverse model families(Qwen、Mistral、Llama、DeepSeek)和规模(0.5B-14B)。这揭示了模型的推理潜力与其固有的、预训练时就能区分可靠知识与不可靠知识的能力密切相关。这些发现凸显了模型预训练在塑造推理方面的关键作用,并为从模型内部机制出发选择/设计更强大的基础模型提供了实用指标。

关键词

引用

@article{arxiv.2510.15216,
  title  = {Soundness-Aware Level: A Microscopic Signature that Predicts LLM Reasoning Potential},
  author = {Xuansheng Wu and Xiaoman Pan and Wenlin Yao and Jianshu Chen},
  journal= {arXiv preprint arXiv:2510.15216},
  year   = {2025}
}

备注

Pre-print