中文

基于 LLM 合成偏好数据的预算感知随时推理

计算与语言 2026-04-21 v2

摘要

我们研究了大型语言模型(LLM)在有限计算预算下的推理行为。在此类设置中,快速产生有用的部分解通常比产生高昂推理成本的穷尽推理更为实用。许多现实任务(如行程规划)要求模型在固定的推理预算内提供最佳输出。我们引入了随时推理框架和 Anytime Index,这是一种量化解决方案质量如何随推理 token 增加而有效提升的指标。为进一步提升效率,我们提出了一种利用 LLM 合成偏好数据的推理时自改进方法,其中模型从自身的推理比较中学习以产生更好的中间解。在 NaturalPlan (Trip)、AIME 和 GPQA 数据集上的实验表明,Grok-3、GPT-oss、GPT-4.1/4o 和 LLaMA 模型均取得了一致的提升,在预算约束下同时提高了推理质量和效率。

关键词

引用

@article{arxiv.2601.11038,
  title  = {Budget-Aware Anytime Reasoning with LLM-Synthesized Preference Data},
  author = {Xuanming Zhang and Shwan Ashrafi and Aziza Mirsaidova and Amir H. Rezaeian and Miguel Ballesteros and Lydia B. Chilton and Zhou Yu and Dan Roth},
  journal= {arXiv preprint arXiv:2601.11038},
  year   = {2026}
}

备注

ACL 2026 Findings, 13 pages, 3 figures, 1 table