面向自适应测试时计算的零开销内省
机器学习
2025-12-24 v4 人工智能
计算与语言
摘要
大型语言模型在推理方面表现出色,但缺乏内省能力,包括预见自身成功的可能性以及实现目标所需的计算资源。人类会利用实时内省来决定投入多少努力、何时进行多次尝试、何时停止,以及何时表示成功或失败。缺乏这种能力,使得 LLM 在做出智能的元认知决策时困难重重。测试时扩展方法如 Best-of-N 通过固定预算的样本数来提高成本和延迟,无论每个样本在生成过程中获得的边际收益如何,且缺乏置信度信号会误导用户,阻碍对更好工具的合理升级,并削弱可信度。学习型验证器或奖励模型可以提供置信度估计,但无法实现自适应推理,同时需要额外模型或前向传递,增加显著成本。我们提出了 ZIP-RC,为模型提供零开销的内省奖励和成本预测。在每个 token 上,ZIP-RC 重用了在进行下一个 token 预测时保留或未使用的 logits,输出对最终奖励和剩余长度的联合分布——无需额外模型、架构修改或推理开销。该联合分布用于计算采样效用,即若按预期完成生成的一组样本的期望最大奖励、总计算量和延迟的线性组合。推理期间,我们最大化该效用,以元动作决定继续哪个 token 前缀,或启动从该位置的采样。在混合难度的数学基准测试上,ZIP-RC 在等价或更低平均成本下,将准确率提高最高可达 12%,并描绘了质量、计算和延迟之间的光滑帕累托前沿。通过提供实时的奖励-成本内省,ZIP-RC 实现了自适应、高效的推理。
引用
@article{arxiv.2512.01457,
title = {Zero-Overhead Introspection for Adaptive Test-Time Compute},
author = {Rohin Manvi and Joey Hong and Tim Seyde and Maxime Labonne and Mathias Lechner and Sergey Levine},
journal= {arXiv preprint arXiv:2512.01457},
year = {2025}
}