Compass-Thinker-7B技术报告
人工智能
2025-08-15 v2
摘要
最近的类R1-Zero研究进一步表明,推理扩展赋予了大语言模型(LLMs)前所未有的推理能力,而强化学习是激发其复杂推理的核心技术。然而,直接在超大规模模型上进行强化学习实验涉及高昂的计算成本和资源需求,带来了显著的风险。我们提出Compass-Thinker-7B模型,旨在以更少的计算资源和成本探索强化学习的潜力,并为进一步研究更大模型的强化学习方案提供见解。Compass-Thinker-7B是通过一个专门设计的强化学习流水线从一个开源模型训练而来的。我们为强化学习流水线精心构建了一个包含3万个可验证数学问题的数据集。通过为不同阶段配置不同难度分布的数据和训练设置,模型的潜力被逐步释放,训练效率得到提高。广泛的评估表明,Compass-Thinker-7B具有卓越的推理潜力,并在数学方面取得了优于同等规模强化学习模型的性能。特别是在具有挑战性的AIME2024评估中,Compass-Thinker-7B达到了40%的准确率。
引用
@article{arxiv.2508.08909,
title = {Compass-Thinker-7B Technical Report},
author = {Anxiang Zeng and Haibo Zhang and Kaixiang Mo and Long Zhang and Shuman Liu and Yanhui Huang and Yawen Liu and Yuepeng Sheng and Yuwei Huang},
journal= {arXiv preprint arXiv:2508.08909},
year = {2025}
}