中文

模式条件化:解锁测试时序级扩展的关键

机器学习 2025-12-02 v1 人工智能 计算与语言

摘要

并行抽样虽期待可实现测试时序级扩展的显著提升,但其有效性受到样本多样性崩溃的严峻限制——即模型集中于少数模式,重复抽样产生相同错误。我们提出模式条件化(ModC)框架,显式地通过专家模型或模式特定前缀分配测试时计算资源。ModC在受控图搜索任务和大型推理基准测试中一致实现序级提升,涵盖0.5B至7B的模型家族和规模。在OpenThoughts上,采用ModC微调Qwen2.5-7B可实现标准训练的4倍效率提升,同时提高最高可达的Pass@k。我们进一步表明,梯度聚类可实现无需显式模式标签的ModC,在诸如NuminaMath等数据集上实现最高10%的提升。最后,我们表明ModC改进了强化学习(RL),并可进一步提升多样性激励型RL方法。这些结果表明,标准训练未能充分利用数据中的多样性,ModC为解锁测试时序级扩展的多样性优势提供了简单而有效的补救方案。

关键词

引用

@article{arxiv.2512.01127,
  title  = {Mode-Conditioning Unlocks Superior Test-Time Scaling},
  author = {Chen Henry Wu and Sachin Goyal and Aditi Raghunathan},
  journal= {arXiv preprint arXiv:2512.01127},
  year   = {2025}
}