Instella:具备卓越性能的完全开源语言模型
计算与语言
2025-11-17 v2 人工智能
机器学习
摘要
大型语言模型(LLM)在广泛任务中展现出了卓越性能,但大多数高性能模型仍为闭源或仅部分开源,限制了透明度与可复现性。在本工作中,我们介绍了 Instella,这是一系列完全开源的三十亿参数语言模型,完全基于公开可用的数据与代码库训练而成。在 AMD Instinct MI300X GPU 的支持下,Instella 通过大规模预训练、通用指令微调以及人类偏好对齐开发而成。尽管使用的预训练 token 数量远少于许多同期模型,Instella 在完全开源模型中取得了 SOTA 结果,并与同等规模的领先开权重模型相媲美。我们进一步发布了两个专门变体:能够处理长达 128K token 上下文长度的 Instella-Long,以及通过在数学任务上进行监督微调与强化学习增强的、专注于推理的 Instella-Math。这些贡献共同确立了 Instella 作为面向社区的透明、高性能且通用的替代方案,推动了开源与可复现语言建模研究的目标。
引用
@article{arxiv.2511.10628,
title = {Instella: Fully Open Language Models with Stellar Performance},
author = {Jiang Liu and Jialian Wu and Xiaodong Yu and Yusheng Su and Prakamya Mishra and Gowtham Ramesh and Sudhanshu Ranjan and Chaitanya Manem and Ximeng Sun and Ze Wang and Pratik Prabhanjan Brahma and Zicheng Liu and Emad Barsoum},
journal= {arXiv preprint arXiv:2511.10628},
year = {2025}
}