中文

SD-E$^2$:面向 Token 预算下推理的语义探索

计算与语言 2026-01-27 v1 人工智能

摘要

小语言模型(SLM)在复杂推理方面存在困难,因为在紧凑的计算预算下探索成本高昂。我们引入了语义多样性-探索-利用(Semantic Diversity-Exploration-Exploitation, SD-E2^2),这是一个强化学习框架,通过优化生成推理轨迹中的语义多样性使探索显式化。利用一个固定的句嵌入模型,SD-E2^2 赋予一个多样性奖励,该奖励捕获了 (i) 语义上不同的求解策略的覆盖范围,以及 (ii) 它们在嵌入空间中的平均成对相异度,而非表面形式的新颖性。该多样性奖励与结果正确性和求解效率结合在一个 z-score 归一化的多目标目标中,以稳定训练。在 GSM8K 上,SD-E2^2 分别比基础 Qwen2.5-3B-Instruct 和强基线 GRPO(GRPO-CFL 和 GRPO-CFEE)高出 +27.4、+5.2 和 +1.5 个百分点,同时平均每个问题发现 9.8 种语义上不同的策略。我们进一步将 MedMCQA 提升至 49.64%,而基础模型为 38.37%,并在更具挑战性的 AIME 基准(1983-2025)上展现出提升,达到 13.28%,而基础模型为 6.74%。这些结果表明,奖励语义新颖性为训练具备推理能力的 SLM 提供了计算上更高效的探索-利用信号。通过引入认知适应——调整推理过程结构而非逐 token 计算——SD-E2^2 为资源受限模型的效率提升提供了一条互补路径。

关键词

引用

@article{arxiv.2601.17982,
  title  = {SD-E$^2$: Semantic Exploration for Reasoning Under Token Budgets},
  author = {Kshitij Mishra and Nils Lukas and Salem Lahlou},
  journal= {arXiv preprint arXiv:2601.17982},
  year   = {2026}
}

备注

Accepted at EACL 2026