通过深层思考标记衡量 LLM 推理努力
计算与语言
2026-02-17 v1
摘要
大型语言模型 (LLM) 通过扩展推理时间计算展示了令人印象深刻的推理能力,这通过长链式思维 (Chain-of-Thought, CoT) 实现。然而,最近的研究表明,原始标记计数是推理质量不可靠的代理:生成长度增加并不一致地与准确率相关,反而可能表示“过度思考”,导致性能下降。本文通过识别深度思考标记来量化推理时间努力——这些标记在模型较深层中发生显著修订后才会收敛。我们在四个具有挑战性的数学和科学基准测试 (AIME 24/25, HMMT 25, GPQA-diamond) 以及多样化的推理导向模型 (GPT-OSS, DeepSeek-R1, Qwen3) 上显示,深度思考比率(深度思考标记在生成序列中的比例)与准确率呈稳健且持续正相关,显著优于基于长度和基于置信度的基线。基于这一洞见,我们引入 Think@n 一种以深度思考比率为指标的测试时间扩展策略。我们展示了 Think@n 在显著降低推理成本方面匹配或超越标准自我一致性性能,通过启用基于短前缀早期拒绝不有前景的生成来实现。
引用
@article{arxiv.2602.13517,
title = {Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens},
author = {Wei-Lin Chen and Liqian Peng and Tian Tan and Chao Zhao and Blake JianHang Chen and Ziqian Lin and Alec Go and Yu Meng},
journal= {arXiv preprint arXiv:2602.13517},
year = {2026}
}
备注
Work in progress