中文

单词作灯塔:利用高级语言提示引导强化学习智能体

人工智能 2024-10-14 v1 计算与语言 机器学习

摘要

强化学习中的稀疏奖励环境对探索提出了重大挑战,常导致学习过程效率低下或不完整。为解决此问题,本工作提出了基于大型语言模型(LLM)的教师-学生强化学习框架,通过分解复杂任务为子目标来指导智能体的学习过程。鉴于LLM能够基于环境结构和目的的文本描述理解RL环境,LLM可以类似人类方式为环境定义的任务提供子目标。为此,提出了三类子目标:相对于智能体的位置目标、对象表示以及由LLM直接生成的语言指令。更重要的是,我们展示了仅在训练阶段查询LLM即可,使智能体能够在环境中无需任何LLM干预。我们通过评估三个开源LLM(Llama、DeepSeek、Qwen)在MiniGrid基准的各种程序生成环境中提取子目标来评估此框架的性能。实验结果表明,基于课程的方法加快了学习速度,增强了复杂任务中的探索,在训练步骤上较最近的稀疏奖励环境基线实现了最高可达30至200倍的加速。

关键词

引用

@article{arxiv.2410.08632,
  title  = {Words as Beacons: Guiding RL Agents with High-Level Language Prompts},
  author = {Unai Ruiz-Gonzalez and Alain Andres and Pedro G. Bascoy and Javier Del Ser},
  journal= {arXiv preprint arXiv:2410.08632},
  year   = {2024}
}