中文

更高性价比:通过重置与丢弃(ReD)提高大型语言模型的推理效率

机器学习 2026-01-30 v1 无序系统与神经网络 人工智能 机器学习

摘要

大型语言模型(LLM)在可验证任务上的性能通常以 pass@k 衡量,即在 k 次尝试中至少一次正确回答问题的概率。固定预算下,更合适的度量是 coverage@cost,即总尝试次数作为函数的平均唯一问题解答数量。我们联系这两个度量,表明 pass@k 的经验观察到的幂律行为导致 coverage@cost(报酬递减)。为解决此问题,我们提出重置丢弃(Reset-and-Discard, ReD)方法,这是一种提升固定预算下 coverage@cost 的查询方法,无论 pass@k 形式如何。此外,给定 pass@k,我们可以定量预测使用 ReD 可节省的总尝试次数。若模型不可获得 pass@k,ReD 亦可推断其幂律指数。在使用 HumanEval 的三个 LLM 上实验表明,ReD 显著减少了达到所需覆盖所需的尝试次数、标记数和美元成本,同时提供了衡量推理幂律的有效方法。

关键词

引用

@article{arxiv.2601.21522,
  title  = {More Bang for the Buck: Improving the Inference of Large Language Models at a Fixed Budget using Reset and Discard (ReD)},
  author = {Sagi Meir and Tommer D. Keidar and Noam Levi and Shlomi Reuveni and Barak Hirshberg},
  journal= {arXiv preprint arXiv:2601.21522},
  year   = {2026}
}