中文

基于选择性观察的结构化动作信用学习 CLI 代理

人工智能 2026-05-11 v1

摘要

命令行界面 (CLI) 代理正在成为与演化文件系统、可执行命令行程序和在线执行反馈进行代理-计算机交互的实用范式。最近的工作使用强化学习 (RL) 从可验证的任务反馈中学习这些交互能力,但鲜有方法利用 CLI 动作的本机结构属性作为学习信号。除该 underutilize 动作结构外,CLI 学习还捆绑了两个代理编码的瓶颈。首先,代理必须从部分观察中识别大型代码库中的任务相关证据。其次,稀疏的终端奖励必须分配给塑造长期多轮轨迹的动作。我们通过 shell 驱动的信息提取和文件编辑任务来研究这些瓶颈。对于选择性观察,我们引入了 σ\sigma-Reveal,这是一种在同一 CLI 上进行 token 预算化上下文选择的推理时机制。对于信用分配,我们提出了动作优势分配 (Action Advantage Assignment, A3\mathrm{A}^3),这是一种保留标准代理 RL 算法复杂度的本机方法。A3\mathrm{A}^3 从 episode 级相对反馈、基于抽象语法树 (AST) 的动作子链残差以及树级轨迹边际构建 turn 级优势。为进一步评估此问题设置,我们构建了 ShellOps,一个覆盖仓库环境中 CLI 任务的可验证数据集套件。

关键词

引用

@article{arxiv.2605.08013,
  title  = {Learning CLI Agents with Structured Action Credit under Selective Observation},
  author = {Haoyang Su and Ying Wen},
  journal= {arXiv preprint arXiv:2605.08013},
  year   = {2026}
}