中文

Kinetics:重新思考测试时规模定律

机器学习 2025-06-23 v3 计算与语言

摘要

我们从实际效率角度重新审视测试时规模定律,揭示更小模型的有效性被严重高估。以计算最优性为基础的 prior work 忽略了推理时策略(如 Best-of-$N、长链式思考)引入的关键内存访问瓶颈。我们的整体分析覆盖0.6B至32B参数的模型,揭示了新的Kinetics规模定律,通过纳入计算与内存访问成本,更能指导资源分配。Kinetics规模定律表明,测试时计算在超过阈值模型上使用比更小模型更有效。这一原因在于,在TTS中,注意力机制而非参数数量成为主导成本因素。针对此现象,我们提出以稀疏注意力为中心的新型规模范式,该范式降低了每个token的成本,使相同资源预算下可实现更长的生成与更多并行样本。实验表明,稀疏注意力模型在低成本场景下在AIME上比稠密模型提升超过60分,在高成本场景下提升超过5分,涵盖了最新稀疏Mixture of Experts模型的评估。这些结果表明,稀疏注意力是实现测试时规模潜力的关键且越来越重要,其中与训练不同,准确率随计算量仍未饱和,持续通过增加生成量提升。代码已公开于 https://github.com/Infini-AI-Lab/Kinetics。

关键词

引用

@article{arxiv.2506.05333,
  title  = {Kinetics: Rethinking Test-Time Scaling Laws},
  author = {Ranajoy Sadhukhan and Zhuoming Chen and Haizhong Zheng and Yang Zhou and Emma Strubell and Beidi Chen},
  journal= {arXiv preprint arXiv:2506.05333},
  year   = {2025}
}