中文

Spark:通过动态分支实现策略感知探索以进行长时序智能体学习

机器学习 2026-01-29 v1 计算与语言

摘要

强化学习使大语言模型能够充当智能体,但为其训练长时序任务仍然具有挑战性,因为高质量轨迹稀缺,尤其是在资源有限的情况下。现有方法通常扩大展开规模并无差别地在中间步骤间分配计算资源。此类尝试本质上将大量计算预算浪费在平凡步骤上,同时无法保证样本质量。为此,我们提出 \textbf{Spark}(\textbf{S}trategic \textbf{P}olicy-\textbf{A}ware explo\textbf{R}ation via \textbf{K}ey-state dynamic branching),一种在关键决策状态选择性分支以实现资源高效探索的新框架。我们的核心洞察是在关键决策点激活自适应分支探索以探测有前景的轨迹,从而实现精确的资源分配,优先采样质量而非盲目覆盖。该设计利用智能体内在的决策信号来减少对人类先验的依赖,使智能体能够自主扩展探索并实现更强的泛化能力。在多样化任务(如具身规划)上的实验表明,\textsc{Spark} 以显著更少的训练样本实现了更优的成功率,即使在未见过的场景中也能展现出稳健的泛化能力。

关键词

引用

@article{arxiv.2601.20209,
  title  = {Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning},
  author = {Jinyang Wu and Shuo Yang and Changpeng Yang and Yuhao Shen and Shuai Zhang and Zhengqi Wen and Jianhua Tao},
  journal= {arXiv preprint arXiv:2601.20209},
  year   = {2026}
}