7B 全开源 Moxin-LLM/VLM——从预训练到基于 GRPO 的强化学习增强
计算与语言
2025-07-08 v6 人工智能
机器学习
摘要
最近,大语言模型(LLMs)经历了显著的变革,其受欢迎程度和能力迅速提升。引领这一演变的是 GPT-4 和 GPT-o1 等专有 LLMs,因其卓越的性能和多功能性在 AI 社区引起了广泛关注。与此同时,LLaMA 等开源 LLMs 因其在多样化应用中易于定制和部署,为 LLMs 日益增长的普及做出了巨大贡献。尽管开源 LLMs 为创新和研究提供了前所未有的机会,但 LLMs 的商业化引发了对透明度、可复现性和安全性的担忧。许多开源 LLMs 通过保留训练代码和数据等关键组件而未能满足基本的透明度要求,这可能阻碍 LLMs 的进一步创新。为了缓解这一问题,我们推出了 Moxin 7B,一个完全开源的 LLM,遵循开放科学、开源、开放数据和开放获取的原则。我们发布了预训练代码和配置、训练和微调数据集以及中间和最终检查点,旨在对完全开源 LLMs 做出持续承诺。在对基础模型进行预训练后,我们使用最先进的 post-training 框架和指令数据对 Moxin Base 模型进行微调,得到 Moxin Instruct 模型。为提升推理能力,我们进一步使用从 DeepSeek R1 蒸馏的思维链数据对 Instruct 模型进行微调,然后按照 DeepSeek R1 的方法使用分组相对策略优化(GRPO)对模型进行微调,得到 Moxin Reasoning 模型。此外,我们基于 Moxin 模型开发了视觉语言模型。实验表明,我们的模型在零样本评估、少样本评估和思维链评估等多种评估中取得了优越性能。
引用
@article{arxiv.2412.06845,
title = {7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement},
author = {Pu Zhao and Xuan Shen and Zhenglun Kong and Yixin Shen and Sung-En Chang and Arash Akbari and Timothy Rupprecht and Lei Lu and Enfu Nan and Changdi Yang and Yumei He and Weiyan Shi and Xingchen Xu and Yu Huang and Wei Jiang and Wei Wang and Yue Chen and Yong He and Yanzhi Wang},
journal= {arXiv preprint arXiv:2412.06845},
year = {2025}
}