中文

小型语言模型用于智能体系统:架构、能力与部署权衡综述

人工智能 2025-10-07 v1 机器学习

摘要

小型语言模型 (SLMs;参数量为 1-12B,情有时之 20B) 在寻求模式约束和 API 约束精度而非开放式生成的智能体工作负载中已足够,且往往优于大型模型。我们综合了最新证据,涵盖开放及专有 SLMs(Phi-4-Mini、Qwen-2.5-7B、Gemma-2-9B、Llama-3.2-1B/3B、Ministral-3B/8B、Apple on-device 3B、DeepSeek-R1-Distill),并将其与现代评估(BFCL v3/v4、StableToolBench)和部署栈(vLLM、SGLang、TensorRT-LLM)搭配使用的引导解码库(XGrammar、Outlines)相关联。我们正式化 SLM 默认、LLM 后备系统,采用不确定性感知路由和验证器级联,并提出反映实际生产目标的工程指标:每成功任务成本 (CPS)、模式有效性率、可执行调用率、p50/p95 延迟以及每请求能耗。引导解码、严格的 JSON Schema 输出以及验证器优先工具执行大幅缩小了与大型模型之间的能力差距,常常使 SLMs 在工具使用、函数调用和 RAG 方面匹配甚至超越 LLMs,同时以 10 倍至 100 倍更低的 token 成本实现显著更好的延迟和能耗。我们提供构建优先使用 SLMs 的智能体堆栈的设计模式:模式优先提示、类型安全函数注册表、带验证器聚合的置信评分以及通过 LoRA/QLoRA 实现的轻量化适配。我们也阐明了后备仍具价值的局限场景(开放域推理和部分长程规划)。最终构建出默认使用 SLMs 且在有针对性 LLM 辅助下保留弹性的快速、低成本且可靠的智能体的实用蓝图。

关键词

引用

@article{arxiv.2510.03847,
  title  = {Small Language Models for Agentic Systems: A Survey of Architectures, Capabilities, and Deployment Trade offs},
  author = {Raghav Sharma and Manan Mehta},
  journal= {arXiv preprint arXiv:2510.03847},
  year   = {2025}
}

备注

9 Pages