中文

有限算力上的推理:LLM 自适应与可控测试时计算综述

流体动力学 2025-07-21 v2 介观与纳米尺度物理

摘要

大语言模型 (LLMs) 已快速发展为能够解决广泛任务的通用智能体。然而,当前模型在推理方面仍不够高效:它们不论任务复杂度,都应用固定的推理时计算,常常在简单问题上过度思考,而在复杂问题上不足以思考。本综述提供了对高效测试时计算 (TTC) 策略的全面回顾,旨在提高 LLM 推理的计算效率。我们引入了两层次的分类法,区分 L1 可控性方法,这些方法在固定计算预算下运行,以及 L2 可适应性方法,这些方法根据输入难度或模型置信度动态调整推理。我们对领先的专有 LLMs 在不同数据集上进行基准测试,突出了推理性能与 token 使用量之间的关键权衡。与既有关于高效推理的综述相比,本回顾强调了 TTC 方法的实用控制、可适应性和可扩展性。最后,我们讨论了诸如混合思考模型等新兴趋势,并指出了未来工作中关键挑战,以实现更高效、更稳健、更符合用户约束的 LLMs。

关键词

引用

@article{arxiv.2507.02075,
  title  = {Particle deposit patterns from evaporation of a sessile colloidal droplet},
  author = {A. Mokhtari and M. AitSaada and S. Chikh and L. Tadrist},
  journal= {arXiv preprint arXiv:2507.02075},
  year   = {2025}
}

备注

The author Mebrouk Ait Saada objects to the publication