Youtu-LLM:释放轻量级大语言模型的原生智能体潜力
计算与语言
2026-01-06 v2
摘要
我们介绍 Youtu-LLM,一个轻量级但功能强大的语言模型,它协调了高计算效率与原生智能体智能。与依赖蒸馏的典型小模型不同,Youtu-LLM(1.96B)是从头开始预训练的,以系统地培养推理和规划能力。关键技术进步如下:(1)支持长上下文的紧凑架构:基于密集的多潜在注意力(MLA)架构和一种新颖的面向 STEM 的词汇表构建,Youtu-LLM 支持 128k 上下文窗口。这种设计能够在最小的内存占用下实现鲁棒的长上下文推理和状态跟踪,使其成为长时域智能体和推理任务的理想选择。(2)有原则的“常识-STEM-智能体”课程:我们策划了一个约 11T token 的大规模语料库,并实施了多阶段训练策略。通过逐步将预训练数据分布从一般常识转移到复杂的 STEM 和智能体任务,我们确保模型获得深层认知能力,而非表面上的对齐。(3)可扩展的智能体中期训练:专门针对智能体中期训练,我们采用多样化的数据构建方案,在数学、编程和工具使用领域合成丰富多样的轨迹。这些高质量数据使模型能够有效地内化规划和反思行为。广泛的评估表明,Youtu-LLM 为 2B 参数以下的 LLM 设立了新的最先进水平。在通用基准测试中,它取得了与更大模型相比具有竞争力的性能,而在智能体特定任务上,它显著超越了现有的 SOTA 基线,证明了轻量级模型可以拥有强大的内在智能体能力。
引用
@article{arxiv.2512.24618,
title = {Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models},
author = {Junru Lu and Jiarui Qin and Lingfeng Qiao and Yinghui Li and Xinyi Dai and Bo Ke and Jianfeng He and Ruizhi Qiao and Di Yin and Xing Sun and Yunsheng Wu and Yinsong Liu and Shuangyin Liu and Mingkong Tang and Haodong Lin and Jiayi Kuang and Fanxu Meng and Xiaojuan Tang and Yunjia Xi and Junjie Huang and Haotong Yang and Zhenyi Shen and Yangning Li and Qianwen Zhang and Yifei Yu and Siyu An and Junnan Dong and Qiufeng Wang and Jie Wang and Keyu Chen and Wei Wen and Taian Guo and Zhifeng Shen and Daohai Yu and Jiahao Li and Ke Li and Zongyi Li and Xiaoyu Tan},
journal= {arXiv preprint arXiv:2512.24618},
year = {2026}
}
备注
57 pages, 26 figures