中文

小型语言模型的推理能力研究

计算与语言 2025-10-01 v3 人工智能 机器学习

摘要

推理能力长期被视为大型语言模型(LLMs)的涌现属性。然而,近期研究挑战了这一假设,表明小型语言模型(SLMs)也能实现与大型模型相当的推理性能。本文引入了ThinkSLM,这是首个系统评估和研究小型语言模型推理能力的全面基准测试,涵盖从零训练或通过量化、剪枝和知识蒸馏等方法衍生的模型。我们首先建立可靠的评估标准,将现有方法与LLM评判者与人类评估进行对比。随后,我们对72个多样化的小型语言模型(来自六大模型家族)在17个推理基准上的表现进行评估。我们重复了所有实验三次,以确保评估的稳健性。研究结果表明:1)小型语言模型的推理能力主要受训练方法和数据质量影响,而非仅由模型规模决定;2)量化保留了推理能力,而剪枝显著破坏了其推理能力;3)大型模型在对抗性扰动和中间推理方面表现出更高的鲁棒性,但某些小型模型的表现不 inferior于大型模型。我们的研究挑战了“仅通过规模扩大才能获得强推理能力”的假设。我们展望未来,小型语言模型若通过结构化训练或后训练压缩技术具备强大的推理能力将成为可能。ThinkSLM Leaderboard已公开:https://ctrl-gaurav.github.io/thinkslm.github.io/。

关键词

引用

@article{arxiv.2502.11569,
  title  = {Towards Reasoning Ability of Small Language Models},
  author = {Gaurav Srivastava and Shuxiang Cao and Xuan Wang},
  journal= {arXiv preprint arXiv:2502.11569},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Main Conference