我们在扩展什么?关于测试时扩展的系统视角
性能
2025-09-25 v1 人工智能
摘要
测试时扩展(TTS)最近作为一种利用预训练大语言模型(LLM)隐藏推理能力的有前景方向而涌现。然而,现有的扩展方法仅聚焦于计算最优的 Pareto 前沿,忽略了一个简单事实:计算最优并不总是系统最优。在本文中,我们提出一种系统导向视角下的 TTS,分析推理模型如何在实际指标(如延迟和每 token 成本)下进行规模化。通过评估流行优化(如张量并行和情境解码)的影响,我们的初步分析揭示了当前方法的局限性,并呼吁向整体、系统感知的评估范式转变,以捕捉推理时间规模化法则的真实本质。
关键词
引用
@article{arxiv.2509.19645,
title = {Are We Scaling the Right Thing? A System Perspective on Test-Time Scaling},
author = {Youpeng Zhao and Jinpeng LV and Di Wu and Jun Wang and Christopher Gooley},
journal= {arXiv preprint arXiv:2509.19645},
year = {2025}
}