中文

小模型,大逻辑:多样性驱动的优化在 VibeThinker-1.5B 中引发大模型推理能力

人工智能 2025-11-11 v1 计算与语言

摘要

挑战当前关于小模型天然缺乏稳健推理能力的共识,这篇报告介绍了 VibeThinker-1.5B——一个由我们提出的 Spectrum-to-Signal Principle (SSP) 训练得到的 15 亿参数稠密模型。这挑战了通过增加模型参数来提升能力(如 DeepSeek R1 (671B) 和 Kimi k2 (>1T))的主流做法。SSP 框架首先采用两阶段多样性探索蒸馏 (SFT) 生成广泛的解答方案,然后通过最大熵引导策略优化 (RL) 放大正确信号。虽然总体训练成本仅为 7800 美元,VibeThinker-1.5B 在推理能力上优于闭源模型如 Magistral Medium 和 Claude Opus 4,与开源模型如 GPT OSS-20B Medium 持平。更值得一提的是,在三个数学基准测试中,VibeThinker-1.5B 分别在 AIME24、AIME25 和 HMMT25 上的得分为 80.3、74.4 和 50.4,显著优于 400 倍大的 DeepSeek R1 (79.8、70.0、41.7)。这在其基础模型 (6.7、4.3 和 0.6) 之上具有巨大提升。在 LiveCodeBench V6 上,VibeThinker-1.5B 得分 51.1,超过 Magistral Medium 的 50.3 和其基础模型的 0.0。这些发现表明,小模型能够实现与大模型相当的推理能力,大幅降低训练和推理成本,从而 democratize 了先进人工智能研究。

关键词

引用

@article{arxiv.2511.06221,
  title  = {Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B},
  author = {Sen Xu and Yi Zhou and Wei Wang and Jixin Min and Zhibin Yin and Yingwei Dai and Shixi Liu and Lianyu Pang and Yirong Chen and Junlin Zhang},
  journal= {arXiv preprint arXiv:2511.06221},
  year   = {2025}
}