当推理胜过规模:一个 1.5B 推理模型作为判别器优于 13B LLM
机器学习
2025-05-08 v1 计算与语言
摘要
具有推理能力的大语言模型(LLM)为改进规划框架中的候选评估提供了一条有前景的路径,但它们相对于传统非推理模型的相对性能在很大程度上仍未得到充分探索。在本研究中,我们在一个用于文本到 SQL 任务的生成器-判别器 LLM 规划框架内,将一个蒸馏的 1.5B 参数推理模型(DeepSeek-R1)与几个最先进的非推理 LLM 进行了基准测试。为此,我们引入了一种从推理的思维链(CoT)输出中提取软分数的新方法,该方法能够对候选进行细粒度排序。我们的核心假设是,推理模型是比非推理 LLM 更有效的判别器。我们的结果表明,蒸馏的 DeepSeek-R1-1.5B 的 F1 分数比 CodeLlama-7B 高出最多 87%,判别准确率高出 3.7%,执行准确率比 CodeLlama-13B 高出 3.7%,尽管其参数数量显著更少。此外,我们发现推理模型的逻辑能力存在限制,仅提供更多上下文或允许更多计算预算进行推理不足以提高其判别性能。最后,我们证明,与非推理 LLM 不同,推理模型发现生成比判别更具挑战性,并且作为生成器可能不如较小的非推理 LLM。我们的工作突显了推理模型在智能体框架中作为判别器的潜力,远超其作为生成器的能力,为它们在 LLM 规划基础设施中的最佳角色提供了见解。
引用
@article{arxiv.2505.03786,
title = {When Reasoning Beats Scale: A 1.5B Reasoning Model Outranks 13B LLMs as Discriminator},
author = {Md Fahim Anjum},
journal= {arXiv preprint arXiv:2505.03786},
year = {2025}
}
备注
12 pages, 5 figures. Code available at: https://github.com/MDFahimAnjum/llm-planning-with-reasoning