中文

LLM推理时计算的实用技巧

人工智能 2025-02-18 v4

摘要

随着大型语言模型(LLM)的发展,解决复杂推理任务的关注度日益增加。推理时计算方法(如Best-of-N、束搜索等)尤为重要,因为它们无需修改模型参数或额外训练即可提升推理性能。然而,这些技术面临实施挑战,大多数现有方法仅处于概念验证阶段,实际应用受限于计算复杂度和在不同任务上的效果差异。本文我们全面评估了各种推理时计算策略在不同复杂度推理任务中的表现。由于当前方法大多依赖提议-验证管道(先生成候选解答如推理解答,再依据奖励信号如RLHF奖励或过程奖励进行选择),我们的研究聚焦于优化候选解答生成(如指令提示词、温度等超参数和top-p)以及奖励机制(如自评估、奖励类型)。通过在Llama、Qwen和Mistral等模型家族中进行大量实验(超过20,000个A100-80G GPU小时,超过1,000次实验),我们的消除实验表明,此前被忽视的策略可显著提升性能(如调节温度可使推理任务性能提升最高5%)。此外,我们建立了标准化的推理时计算基准,系统评估了六种代表性方法在八个推理任务上的表现。这些发现为未来研究提供了更坚实的基础。代码已开源于https://github.com/usail-hkust/benchmark_inference_time_computation_LLM。

关键词

引用

@article{arxiv.2502.07191,
  title  = {Bag of Tricks for Inference-time Computation of LLM Reasoning},
  author = {Fan Liu and Wenshuo Chao and Naiqiang Tan and Hao Liu},
  journal= {arXiv preprint arXiv:2502.07191},
  year   = {2025}
}