中文

ARISE:面向大规模推理模型的自适应分辨率感知测试时扩展评估指标

人工智能 2025-10-08 v1

摘要

测试时扩展已成为提升大规模推理模型性能的变革性范式,使模型在推理期间能够动态分配计算资源。然而,随着推理模型版图的快速扩张,一个关键问题仍未解决:如何系统地比较和评估不同模型的测试时扩展能力?本文引入 ARISE(Adaptive Resolution-aware Scaling Evaluation),一种新型指标,专为评估大规模推理模型的测试时扩展效果而设计。与现有评估方法不同,ARISE 包含两个关键创新:(1) 样本级感知,有效惩罚测试时扩展行为中计算增加导致性能下降的现象;(2) 动态抽样机制,减轻准确率波动和 token 计数不稳定对最终评估的影响。我们进行了全面实验,评估了包括数学推理、代码生成和智能体任务在内的当前最先进推理模型。我们的结果表明,ARISE 提供了可靠且细粒度的测试时扩展能力测量,揭示了不同模型之间在扩展效率上的显著差异。值得注意的是,我们的评估识别出 Claude Opus 在扩展特征方面优于其他当代推理模型。

关键词

引用

@article{arxiv.2510.06014,
  title  = {ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models},
  author = {Zhangyue Yin and Qiushi Sun and Zhiyuan Zeng and Zhiyuan Yu and Qipeng Guo and Xuanjing Huang and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2510.06014},
  year   = {2025}
}

备注

19 pages, 7 figures