中文

关于平行思维的规模诅咒:系统效能与样本效率的矛盾

机器学习 2026-05-12 v2 人工智能 计算与语言

摘要

平行思维通过多路径抽样和聚合来提高 LLM 的推理能力。在标准评估中,由于缺乏样本特定的先验,所有样本共享的全局预算旨在最大化数据集准确率。然而,许多样本在 much smaller 的预算下即可达到最佳准确率,导致预算利用率低下。这种系统效能与样本效率之间的矛盾构成了规模诅咒。本文首先对规模诅咒进行形式化分析,量化其在真实系统中的流行程度和严重程度。为突破这一困境,我们提出了潜在预算预测器(LanBo),通过探测模型的潜在表示来预测样本特定的最优预算。LanBo 在保持数据集准确率的同时显著提高了预算利用率。我们进一步将 LanBo 集成到完整的解码管道中,催生了前置解码预算适应(PreAda)范式——该范式在解码前分配预算,以保持解码时的并行化。LanBo 在延迟和内存方面的硬件感知效率显著提升,证明了其实际价值以及 LanBo 用于高效平行解码的潜力。

关键词

引用

@article{arxiv.2601.21619,
  title  = {On the Overscaling Curse of Parallel Thinking: System Efficacy Contradicts Sample Efficiency},
  author = {Yiming Wang and Zhuosheng Zhang and Rui Wang},
  journal= {arXiv preprint arXiv:2601.21619},
  year   = {2026}
}

备注

44 pages, 66 figures, 24 tables