中文

复杂任务的推理时间扩展:我们目前所处的情况及未来展望

机器学习 2025-04-02 v1 人工智能 计算与语言

摘要

推理时间扩展可增强大型语言模型(LLM)在复杂问题上的推理能力,这类问题受益于逐步问题解决。虽然延长生成的scratchpad已在数学任务中证明有效,但这种方法对其他任务的更广泛影响尚不明确。本文我们在九个最先进模型和八个具有挑战性任务(包括数学与STEM推理、日历规划、NP难题、导航及空间推理)上探讨了扩展方法的优势与局限性。我们将常规模型(如GPT-4o)与针对推理时间扩展微调的模型(如o1)通过包含重复模型调用的评估协议进行比较,无论是独立调用还是带反馈的顺序调用。这些评估模拟了每个模型的下界和上界以及潜在的未来性能提升,无论是通过增强训练还是多模型推理系统。我们的广泛实证分析表明,推理时间扩展的优势在不同任务之间存在差异,且随问题复杂度增加而减弱。此外,仅使用更多标记并不一定在这些具有挑战性的情境中导致更高准确率。来自使用完美验证器的常规模型进行的多次独立运行结果表明,对于某些任务,这些模型可接近今天最先进推理模型的平均性能。然而,对于其他任务,即使在非常高的扩展规模下,也仍存在显著的性能差距。充满希望的是,所有模型在推理进一步扩展且使用完美验证器或强反馈时均显示出显著提升,表明未来的改进仍有广阔潜力。

关键词

引用

@article{arxiv.2504.00294,
  title  = {Inference-Time Scaling for Complex Tasks: Where We Stand and What Lies Ahead},
  author = {Vidhisha Balachandran and Jingya Chen and Lingjiao Chen and Shivam Garg and Neel Joshi and Yash Lara and John Langford and Besmira Nushi and Vibhav Vineet and Yue Wu and Safoora Yousefi},
  journal= {arXiv preprint arXiv:2504.00294},
  year   = {2025}
}