中文

扩大 LLM 终端能力的数据工程

计算与语言 2026-02-25 v1

摘要

尽管近期大语言模型终端能力取得了快速进展,但支撑领先终端代理所采用的训练数据策略却鲜有披露。我们通过系统性研究终端代理的数据工程实践来弥补这一空白,主要做出两方面贡献:(1) Terminal-Task-Gen,这是一个轻量级合成任务生成管道,支持基于种子和基于技能的任务构建;(2) 对数据与训练策略的全面分析,包括过滤、课程学习、长上下文训练以及规模化行为。我们的管道生成了 Terminal-Corpus,这是一个大规模开源终端任务数据集。使用该数据集,我们训练了源自 Qwen3(8B, 14B, 32B) 的 Nemotron-Terminal 模型家族,实现了在 Terminal-Bench 2.0 上的显著提升:Nemotron-Terminal-8B 从 2.5% 提升至 13.0%,Nemotron-Terminal-14B 从 4.0% 提升至 20.2%,Nemotron-Terminal-32B 从 3.4% 提升至 27.4%,相当于匹配了显著更大规模的模型性能。为加速该领域的研究,我们将模型检查点及大部分合成数据集开源发布于 https://huggingface.co/collections/nvidia/nemotron-terminal。

关键词

引用

@article{arxiv.2602.21193,
  title  = {On Data Engineering for Scaling LLM Terminal Capabilities},
  author = {Renjie Pi and Grace Lam and Mohammad Shoeybi and Pooya Jannaty and Bryan Catanzaro and Wei Ping},
  journal= {arXiv preprint arXiv:2602.21193},
  year   = {2026}
}