SAGE-32B:基于迭代蒸馏的智能体推理
人工智能
2026-04-22 v2 计算与语言
机器学习
摘要
我们展示了 SAGE-32B,这是一个拥有 320 亿参数的语言模型,专注于智能体推理和长远规划任务。与旨在实现通用对话流畅性的聊天模型不同,SAGE-32B被设计用于在智能体循环中运行,强调任务分解、工具使用和错误恢复。该模型基于 Qwen2.5-32B 预训练模型初始化,并通过迭代蒸馏进行微调,这是一种两阶段训练过程,通过严格测试的反馈循环来提高推理性能。SAGE-32B 还引入了逆向推理方法,该方法使用元认知头部在执行前预测规划过程中潜在的失败。在包括 MMLU-Pro、AgentBench 和 MATH-500 在内的智能体推理基准测试中,SAGE-32B 在多工具使用场景下的成功率高于 similarly 大小的基线模型,同时在标准推理评估中保持竞争力。模型权重已在 https://huggingface.co/sagea-ai/sage-reasoning-32b 上公开发布。
引用
@article{arxiv.2601.04237,
title = {SAGE-32B: Agentic Reasoning via Iterative Distillation},
author = {Basab Jha and Firoj Paudel and Ujjwal Puri and Ethan Henkel and Zhang Yuting and Mateusz Kowalczyk and Mei Huang and Choi Donghyuk and Wang Junhao},
journal= {arXiv preprint arXiv:2601.04237},
year = {2026}
}
备注
23 Pages, 3 figures, 4 tables