PCMind-2.1-Kaiyuan-2B 技术报告
计算与语言
2025-12-09 v1 人工智能
机器学习
摘要
大语言模型(LLM)的快速发展在开源社区与产业界之间造成了显著的知识差距,主要因为后者依赖闭源的高质量数据和训练方案。为解决这一问题,我们提出 PCMind-2.1-Kaiyuan-2B,一个完全开源的 20 亿参数模型,专注于在资源受限条件下提升训练效率与效果。我们的方法包括三项关键创新:一种分位数数据基准测试方法,用于系统比较异构开源数据集并提供数据混合策略的见解;一种多阶段范式内的策略性选择性重复方案,以有效利用稀疏的高质量数据;以及一种多领域课程训练策略,按质量对样本排序。在高度优化的数据预处理流水线与针对 FP16 稳定性的架构修改支持下,Kaiyuan-2B 实现了与最先进的完全开源模型相媲美的性能,展示了面向资源受限预训练的实用且可扩展的解决方案。我们在 Apache 2.0 许可证下发布所有资产(包括模型权重、数据和代码),地址为 https://huggingface.co/thu-pacman/PCMind-2.1-Kaiyuan-2B。
引用
@article{arxiv.2512.07612,
title = {PCMind-2.1-Kaiyuan-2B Technical Report},
author = {Kairong Luo and Zhenbo Sun and Xinyu Shi and Shengqi Chen and Bowen Yu and Yunyi Chen and Chenyi Dang and Hengtao Tao and Hui Wang and Fangming Liu and Kaifeng Lyu and Wenguang Chen},
journal= {arXiv preprint arXiv:2512.07612},
year = {2025}
}