中文

Nanbeige4.1-3B:一个既能推理又能对齐又能行动的小型通用模型

人工智能 2026-02-17 v1 计算与语言

摘要

我们提出了 Nanbeige4.1-3B,这是一个统一的通用型语言模型,仅需 30 亿参数即可同时实现强大的智能体行为、代码生成和通用推理能力。据我们所知,这是首个在单个模型中实现此等多功能性的开源小型语言模型(SLM)。为提升推理能力和偏好对齐效果,我们组合使用了点评模型和配对奖励建模,确保高质量、符合人类取向的响应。对于代码生成,我们设计了复杂度感知奖励的强化学习,优化了正确性和效率。 在深度搜索过程中,我们进行了复杂的数据合成,并在训练中融入了轮次级监督。这使得 Nanbeige4.1-3B 能够可靠地执行最长达 600 次工具调用,以解决复杂问题。大量实验结果表明,Nanbeige4.1-3B 在规模相似的先前模型(如 Nanbeige4-3B-2511 和 Qwen3-4B)方面表现显著优于,甚至超过了诸如 Qwen3-30B-A3B 等更大规模模型。我们的研究表明,小型模型可以同时实现广泛的能力和强大的专业化,重新定义了 30 亿参数模型的潜力。

关键词

引用

@article{arxiv.2602.13367,
  title  = {Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts},
  author = {Chen Yang and Guangyue Peng and Jiaying Zhu and Ran Le and Ruixiang Feng and Tao Zhang and Xiyun Xu and Yang Song and Yiming Jia and Yuntao Wen and Yunzhi Xu and Zekai Wang and Zhenwei An and Zhicong Sun and Zongchao Chen},
  journal= {arXiv preprint arXiv:2602.13367},
  year   = {2026}
}