中文

这不那么简单。对简单测试时扩展的分析

机器学习 2025-07-22 v1 人工智能 计算与语言

摘要

先前的工作提出了简单测试时扩展方法,这是一种通过手动控制测试时计算量来复制这种扩展行为的方法,从而从类o1模型中蒸馏的模型:通过强制最大长度来缩小计算量,或通过在模型即将终止生成时反复追加“等待”来放大计算量。本文对简单测试时扩展进行了分析,发现这种扩展行为主要归因于通过强制最大长度来缩小计算量。相比之下,针对来自o1模型蒸馏的长CoT数据进行微调对扩展行为几乎没有显著影响,另外,通过追加“等待”来放大计算量会导致不一致,因为模型可能会在解决方案之间振荡。简单测试时扩展与类o1模型(如DeepSeek-R1@)之间的一个关键区别在于,这些模型通常被允许使用所需的计算量,唯一的约束仅是模型支持的最大长度。通过在强化学习期间自然学习放大测试时计算量,o1模型在放大后超过了其峰值性能。相比之下,简单测试时扩展在缩小计算量时会逐步降低模型性能的上限。虽然通过缩小来复制o1模型的测试时扩展行为相当直接,但关键是要认识到,测试时计算量扩展的目标是释放更高的性能——超出模型原本能够实现的范围——而不仅仅是复制扩展行为的外观。

关键词

引用

@article{arxiv.2507.14419,
  title  = {It's Not That Simple. An Analysis of Simple Test-Time Scaling},
  author = {Guojun Wu},
  journal= {arXiv preprint arXiv:2507.14419},
  year   = {2025}
}