中文

SCALAR:通过LLM引导的符号规划与深度RL grounding 学习与组合技能

机器学习 2026-03-11 v1

摘要

基于语言模型的智能体在给定高级操作API时表现出色,但难以将语言锚定到低层控制。先前的工作让LLM生成技能或奖励函数,但这些一次性方法缺乏纠正规范错误的反馈。我们引入SCALAR,一个双向框架将LLM规划与RL通过学习技能库进行耦合。LLM提出具有前置条件和效果的技能;RL为每个技能训练策略并将执行结果反馈给迭代细化规范,从而提高对初始错误的鲁棒性。 Pivotal Trajectory Analysis通过分析RL轨迹来纠正LLM先验;Frontier Checkpointing可选在技能边界保存环境状态以提高样本效率。在Craftax上,SCALAR实现了88.2%的钻石收集,比最佳基线提高1.9倍,在Gnomish Mines中达成9.1%的成功率,而先前方法在此完全失败。

关键词

引用

@article{arxiv.2603.09036,
  title  = {SCALAR: Learning and Composing Skills through LLM Guided Symbolic Planning and Deep RL Grounding},
  author = {Renos Zabounidis and Yue Wu and Simon Stepputtis and Woojun Kim and Yuanzhi Li and Tom Mitchell and Katia Sycara},
  journal= {arXiv preprint arXiv:2603.09036},
  year   = {2026}
}

备注

Best Paper Award Honorable Mention at NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning