Chronos:面向测试时扩展的时间推理链建模
计算与语言
2026-02-03 v1
摘要
测试时扩展(TTS)已成为提高大型语言模型(LLM)推理性能的有效范式;然而,现有方法——尤其是多数投票法和启发式的token级评分方法——对推理轨迹或token相等对待,因而易受轨迹质量差异和局部逻辑失效的影响。在本工作中,我们引入了Chronos——一种轻量级且即插即用的时间顺序推理评分器,专为建模推理链的时间动态而设计。具体而言,Chronos学习捕捉token概率的轨迹特征,据此赋予质量评分,并采用加权投票机制。对In-domain和Out-domain基准的广泛评估表明,Chronos在多种模型上均能实现显著提升,计算开销几乎可忽略不计。值得注意的是,在Qwen3-4B-Thinking-2507上,Chronos@128相较于Pass@1实现了34.21%的相对提升,相较于Maj@128实现了22.70%的相对提升,凸显了其有效性。
引用
@article{arxiv.2602.01208,
title = {Chronos: Learning Temporal Dynamics of Reasoning Chains for Test-Time Scaling},
author = {Kai Zhang and Jiayi Liao and Chengpeng Li and Ziyuan Xie and Sihang Li and Xiang Wang},
journal= {arXiv preprint arXiv:2602.01208},
year = {2026}
}