OckBench:衡量大语言模型推理效率的基准
计算与语言
2026-02-25 v2 人工智能
摘要
大型语言模型(LLM)如 GPT-5 和 Gemini 3 已推动了自动推理和代码生成的前沿。然而,当前基准测试侧重于准确率和输出质量,忽略了一个关键维度:token 使用的效率。token 效率在实际应用中差异极大。解决相同问题且准确率相似的模型,可能在 token 长度上存在最高达 \textbf{5.0} 的差异,这导致模型推理能力的巨大差距。这种差异暴露了显著的冗余,凸显了制定标准化基准来量化 token 效率差距的紧迫需求。因此,我们引入 OckBench,这是第一个同时衡量推理和编码任务中准确率和 token 效率的基准。我们的评估显示,当前模型的 token 效率仍高度未被优化,显著推高了服务成本和延迟。这些发现为社区优化潜在推理能力和 token 效率提供了具体的路线图。最终,我们主张必须转变评估范式:token 绝不能不经必要地被放大。我们的基准可在 https://ockbench.github.io/ 上访问。
引用
@article{arxiv.2511.05722,
title = {OckBench: Measuring the Efficiency of LLM Reasoning},
author = {Zheng Du and Hao Kang and Song Han and Tushar Krishna and Ligeng Zhu},
journal= {arXiv preprint arXiv:2511.05722},
year = {2026}
}