中文

基于大语言模型的强化学习中目标引导的高效探索

机器学习 2025-09-29 v1

摘要

现实世界的决策任务通常发生在复杂开放的环境中,对强化学习(RL)智能体的探索效率和长时序规划能力构成重大挑战。一种有前景的方法是LLM增强的RL,它利用大语言模型(LLM)丰富的先验知识和强大的规划能力来引导RL智能体进行高效探索。然而,现有方法大多依赖频繁且昂贵的大语言模型调用,并且由于语义不匹配而性能受限。在本文中,我们提出了一种结构化目标引导强化学习(SGRL)方法,该方法集成了一个结构化目标规划器和一个目标条件动作剪枝器,以引导RL智能体进行高效探索。具体而言,结构化目标规划器利用大语言模型生成一个可复用的结构化目标生成函数,其中目标按优先级排序。此外,通过利用大语言模型确定目标的优先级权重,它动态生成前瞻性目标,以引导智能体策略走向更有前景的决策轨迹。目标条件动作剪枝器采用动作掩码机制,过滤掉与当前目标不一致的动作,从而约束RL智能体选择与目标一致的策略。我们在Crafter和Craftax-Classic上评估了所提方法,实验结果表明SGRL在性能上优于现有最先进方法。

关键词

引用

@article{arxiv.2509.22008,
  title  = {Goal-Guided Efficient Exploration via Large Language Model in Reinforcement Learning},
  author = {Yajie Qi and Wei Wei and Lin Li and Lijun Zhang and Zhidong Gao and Da Wang and Huizhong Song},
  journal= {arXiv preprint arXiv:2509.22008},
  year   = {2025}
}