中文

Sticker-TTS:利用历史经验与贴纸驱动的测试时扩展框架

人工智能 2025-09-09 v2 计算与语言

摘要

大型推理模型在复杂推理任务上表现出色,通过增加推理时的计算预算可以进一步提升性能。然而,当前的测试时扩展方法主要依赖冗余采样,忽略了历史经验的利用,从而限制了计算效率。为克服这一局限,我们提出了Sticker-TTS,一个新颖的测试时扩展框架,它协调三个协作的LRM,在历史尝试的引导下迭代探索和优化解决方案。我们框架的核心是提炼出的关键条件——称为贴纸——它们驱动着多轮推理中关键信息的提取、精炼和重用。为进一步提升框架的效率和性能,我们引入了一种结合模仿学习与自我改进的两阶段优化策略,以实现渐进式精炼。在包括AIME-24、AIME-25和OlymMATH在内的三个具有挑战性的数学推理基准上的广泛评估表明,在可比的推理预算下,Sticker-TTS始终优于强基线,包括自一致性方法和先进的强化学习方法。这些结果突显了贴纸引导的历史经验利用的有效性。我们的代码和数据可在https://github.com/RUCAIBox/Sticker-TTS获取。

关键词

引用

@article{arxiv.2509.05007,
  title  = {Sticker-TTS: Learn to Utilize Historical Experience with a Sticker-driven Test-Time Scaling Framework},
  author = {Jie Chen and Jinhao Jiang and Yingqian Min and Zican Dong and Shijie Wang and Wayne Xin Zhao and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2509.05007},
  year   = {2025}
}

备注

11 pages, 1 figures, 5 tables