中文

Terminus-4B:小型模型能否在 agentic 执行任务中取代前沿 LLM?

人工智能 2026-05-06 v1 软件工程

摘要

现代编码 agent 越来越倾向于将 specialized 子任务委托给 subagent,这些 subagent 是较小的、专注的 agentic 循环,负责处理诸如搜索、调试或终端执行等狭窄职责。这种架构模式通过将冗长输出(如构建日志、测试结果等)隔离在 subagent 上下文中,保持主 agent 的上下文窗口干净。通常情况下,agent 在使用 subagent 处理此类任务时会使用前沿模型作为这些 subagent。本文我们探讨了微调小型语言模型(SLM)是否能够在 agentic 终端执行任务中实现与前沿模型相当的性能。我们提出的 Terminus-4B 是通过监督微调(SFT)和强化学习(RL)使用基于 rubric 的 LLM-as-judge reward 进行后训练的 Qwen3-4B 模型,专为此任务而设计。在我们广泛的评估涵盖各种前沿模型、训练 ablation 和主 agent 配置后,我们发现 Terminus-4B 能够将主 agent 的 token 使用量相对于无 subagent 的基线降低约 30%,而不会影响在 SWE-Bench Pro 和我们内部的 SWE-Bench C# 基准上的性能(后者倾向于包含大量冗长的执行任务)。此外,Terminus-4B 在关键指标上取得了改善,表明主 agent 依赖于 subagent 的输出并自行执行更少的终端操作任务。我们看到我们的模型不仅在 Vanilla Qwen 模型与 Claude Sonnet / Opus / GPT-5.3-Codex 等前沿模型之间缩小了差距,而且常常甚至超过了这些前沿模型的性能。

关键词

引用

@article{arxiv.2605.03195,
  title  = {Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?},
  author = {Spandan Garg and Vikram Nitin and Yufan Huang},
  journal= {arXiv preprint arXiv:2605.03195},
  year   = {2026}
}