中文

LgTS:利用LLM生成的子目标对强化学习智能体进行动态任务采样

人工智能 2023-10-17 v1 机器学习

摘要

大型语言模型(LLM)推理能力的最新进展促进了其在需要机器人与人工智能体高层规划的问题中的使用。然而,当前利用LLM进行此类规划任务的技术做出了某些关键假设,例如:可访问允许微调的数据集、精心设计的仅向LLM提供相关且必要信息的提示,以及最重要的,一种确定性方法以允许以现有策略或规划算子的形式执行LLM响应。在这项工作中,我们提出LgTS(LLM引导的师生学习),一种新颖的方法,其探索LLM的规划能力,为无法访问环境转移动力学的强化学习(RL)智能体提供子目标的图表示。该RL智能体使用师生学习算法学习一组从起始状态到达目标状态的成功策略,同时最小化环境交互次数。与先前利用LLM的方法不同,我们的方法不假设可访问专有或微调的LLM,也不要求预训练的策略来实现LLM提出的子目标。通过在基于网格世界的DoorKey领域和受搜索救援启发的领域上的实验,我们表明生成子目标的图结构有助于为LLM提出的子目标学习策略,且师生学习算法在转移动力学未知时最小化环境交互次数。

关键词

引用

@article{arxiv.2310.09454,
  title  = {LgTS: Dynamic Task Sampling using LLM-generated sub-goals for Reinforcement Learning Agents},
  author = {Yash Shukla and Wenchang Gao and Vasanth Sarathy and Alvaro Velasquez and Robert Wright and Jivko Sinapov},
  journal= {arXiv preprint arXiv:2310.09454},
  year   = {2023}
}