中文

面向 LLM 引导的开放世界强化学习的子目标图增强规划

机器学习 2025-12-09 v2 人工智能

摘要

大型语言模型(LLM)通过将任务分解为子目标,为强化学习(RL)提供了强大的高层规划能力。然而,其实际效用受到规划-执行对齐不佳的限制,这反映了抽象计划与可执行、环境兼容行为之间的关键差距。这种不对齐源于两个相互关联的局限性:(1)由于缺乏对环境特定知识的充分扎根,LLM 常常产生语义上合理但在目标环境中不可行或不相关的子目标;(2)单一 LLM 规划将生成与自我验证混为一谈,导致过于自信但不可靠的子目标,这些子目标在执行过程中经常失败。为应对这些挑战,我们提出了子目标图增强的 Actor-Critic-Refiner(SGA-ACR),这是一个将特定环境的子目标图和结构化实体知识与多 LLM 规划流程相结合的框架,该流程明确分离了生成、批判和细化,以产生可执行和可验证的子目标。子目标追踪器进一步监控执行进度,提供辅助奖励,并自适应地更新子目标图,以保持计划与行动之间的对齐。在开放世界游戏“Crafter”中 22 个多样化任务上的实验结果证明了我们所提出方法的有效性。

关键词

引用

@article{arxiv.2511.20993,
  title  = {Subgoal Graph-Augmented Planning for LLM-Guided Open-World Reinforcement Learning},
  author = {Shanwei Fan and Bin Zhang and Zhiwei Xu and Yingxuan Teng and Siqi Dai and Lin Cheng and Guoliang Fan},
  journal= {arXiv preprint arXiv:2511.20993},
  year   = {2025}
}