中文

利用大语言模型引导搜索合成程序化强化学习策略

机器学习 2025-03-12 v3 人工智能 编程语言

摘要

程序化强化学习(PRL)已被探索用于通过程序表示策略,以实现可解释性和泛化性。尽管取得了有希望的结果,但当前最先进的PRL方法受到样本效率低下的困扰,需要数千万次的程序-环境交互。为了应对这一挑战,我们引入了一种新颖的LLM引导搜索框架(LLM-GS)。我们的关键见解是利用LLM的编程专业知识和常识推理来提高无假设、随机猜测搜索方法的效率。我们通过提出一种Pythonic-DSL策略来解决LLM无法在领域特定语言(DSL)中生成精确且语法正确的程序的挑战——即指示LLM首先生成Python代码,然后将其转换为DSL程序。为了进一步优化LLM生成的程序,我们开发了一种名为“计划爬山”的搜索算法,旨在高效探索程序化搜索空间以持续改进程序。在Karel领域的实验结果表明,我们的LLM-GS框架具有卓越的有效性和效率。大量的消融研究进一步验证了我们的Pythonic-DSL策略和计划爬山算法的关键作用。此外,我们通过两个新任务的实验表明,LLM-GS使得没有编程技能以及领域或DSL知识的用户能够用自然语言描述任务,从而获得高性能的程序。

关键词

引用

@article{arxiv.2405.16450,
  title  = {Synthesizing Programmatic Reinforcement Learning Policies with Large Language Model Guided Search},
  author = {Max Liu and Chan-Hung Yu and Wei-Hsu Lee and Cheng-Wei Hung and Yen-Chun Chen and Shao-Hua Sun},
  journal= {arXiv preprint arXiv:2405.16450},
  year   = {2025}
}