别过度思考:基于 Rollout 间动作一致性的自适应计算信号
人工智能
2026-04-10 v1 计算与语言
多智能体系统
摘要
推理时间计算扩展已成为提高大型语言模型 (LLM) 智能体可靠性的强大技术,但现有方法应用均匀地分配计算:每个决策步骤都获得相同的预算,无论其难易程度如何。我们引入 TrACE (Trajectorical Adaptive Compute via agrEement),一个无需训练的控制器,通过测量 Rollout 之间动作一致性来在智能体时间步之间分配 LLM 调用。每个步骤上,TrACE 对小组候选下一个动作进行采样,并衡量模型对相同动作的持续性。高一致性表示容易的决定;控制器立即提交。在一致性较低的地方表示不确定性;控制器在提交给多数动作前采样额外的 Rollout,最多达到可配置的上限。不需要学习组件、不需要外部验证器,也不需要人类标签。我们在两个基准上评估 TrACE:一个是 GSM8K (n=50) 的单步骤推理,另一个是 MiniHouse (n=30) 的多步骤家庭导航,使用运行在 CPU 上的 Qwen 2.5 3B Instruct 模型。TrACE-4 在 GSM8K 上匹配 SC-4 的准确率,同时使用 33% 更少的 LLM 调用;在 MiniHouse 上使用 39% 更少的调用。TrACE-8 在 GSM8K 上匹配 SC-8 的准确率,同时使用 55% 更少的调用;在 MiniHouse 上使用 65% 更少的调用。我们进一步表明,Rollout 之间一致性是步骤级别成功可靠信号,验证了模型自身输出一致性编码难度信息可被无需训练利用的核心假设。TrACE 是首个在多步骤序列决策任务上评估的、无需训练的、按时间步自适应计算控制器。
引用
@article{arxiv.2604.08369,
title = {Don't Overthink It: Inter-Rollout Action Agreement as a Free Adaptive-Compute Signal for LLM Agents},
author = {Khushal Sethi},
journal= {arXiv preprint arXiv:2604.08369},
year = {2026}
}