先驱智能体:生产环境中小型语言模型的持续改进
人工智能
2026-04-14 v1 计算与语言
机器学习
多智能体系统
摘要
小型语言模型因成本低、推理快以及易于专业化而具备上线部署的吸引力。然而,仅凭训练本身难以适应特定任务,这种工程化循环更多由周边决策驱动:数据精选、故障诊断、回归避免、迭代控制。我们提出先驱智能体 (Pioneer Agent),构建一个闭环系统以自动化此整个生命周期。在冷启动模式下,仅凭自然语言任务描述,智能体获取数据、构建评估集,并通过联合优化数据、超参数和学习策略来迭代训练模型。在生产模式下,给定已部署模型及其标记错误,智能体诊断错误模式、构建针对性训练数据,并在显式回归约束下进行再训练。为评估此场景,我们引入 AdaptFT-Bench,这是一个包含合成推断日志的数据集,噪声程度逐步增加,旨在测试完整适应循环:诊断、课程综合、再训练和验证。在八个冷启动基准(涵盖推理、数学、代码生成、摘要和分类)上,先驱智能体相对于基线模型提升 1.6-83.8 分。在 AdaptFT-Bench 上,七个情形中均实现性能提升或保持,而天真再训练最多会因 43 分而下降。在两个基于公共基准任务构建的生产式部署中,它将意图分类提升至 84.9% 至 99.3%,实体 F1 从 0.345 提升至 0.810。除性能提升外,智能体常常从下游反馈中发现有效训练策略,包括链式思维监督、任务特定优化以及以质量为导向的数据精选。
引用
@article{arxiv.2604.09791,
title = {Pioneer Agent: Continual Improvement of Small Language Models in Production},
author = {Dhruv Atreja and Julia White and Nikhil Nayak and Kelton Zhang and Henrijs Princis and George Hurn-Maloney and Ash Lewis and Urchade Zaratiana},
journal= {arXiv preprint arXiv:2604.09791},
year = {2026}
}
备注
43 pages, 10 figures, 14 tables