THINK-Bench: 评估大型推理模型的思维效率与思维链质量
计算与语言
2025-05-29 v1
摘要
大型推理模型 (LRMs) 在复杂任务中取得了令人瞩目的性能,往往优于传统的大型语言模型 (LLMs)。然而,普遍存在的过度思考问题严重限制了其计算效率。当模型生成过多且冗余的 token,而这些 token 对准确结果贡献甚微时,就会发生过度思考,尤其是在简单任务中,这会导致计算资源的严重浪费。为了系统地研究这一问题,我们引入了 Think-Bench,一个旨在评估 LRMs 推理效率的基准。我们还提出了新颖的效率指标,并从多个维度对各种 LRMs 进行了全面评估,包括推理过程、结果质量和思维链 (CoT) 特征。我们的分析表明,大多数 LRMs 在处理简单问题时表现出过度思考,生成不必要的冗长推理链。虽然许多 LRMs 展现出高 CoT 质量,但其中一些效率低下。我们希望 Think-Bench 能作为推进 LRMs 研究的坚实基础。
引用
@article{arxiv.2505.22113,
title = {THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models},
author = {Zhiyuan Li and Yi Chang and Yuan Wu},
journal= {arXiv preprint arXiv:2505.22113},
year = {2025}
}
备注
20 pages, 8 figures, 6 tables