ROI-推理:通过预计算元认知实现推理的理性优化
人工智能
2026-01-08 v1
摘要
大型语言模型(LLM)可通过充足的计算量实现强大的推理性能,但它们本身并不知道任务所需的计算量。我们研究在严格的全局 token 限制下,对多个任务进行预算化的推理时间推理,将其形式化为有序随机多选背包问题(OS-MCKP)。这种视角突显了元认知要求——预测任务难度、估计投资回报(ROI),并策略性地分配计算资源。我们提出了 ROI-推理(ROI-Reasoning)框架,赋予 LLM 内在的、预算感知的理性。首先,元认知微调教会模型在生成前预测推理成本和预期效用,实现明确的求解或跳过决策。随后,理性感知强化学习在硬性 token 预算下优化顺序决策,使模型学习长期分配策略。在预算化的数学推理基准测试中,ROI-推理在保持整体得分的同时,在紧张的计算预算下显著减少 regret。
引用
@article{arxiv.2601.03822,
title = {ROI-Reasoning: Rational Optimization for Inference via Pre-Computation Meta-Cognition},
author = {Muyang Zhao and Qi Qi and Hao Sun},
journal= {arXiv preprint arXiv:2601.03822},
year = {2026}
}