中文

LLM-Explorer:由大型语言模型驱动的强化学习策略探索增强插件

机器学习 2025-10-24 v2 人工智能

摘要

策略探索是强化学习(RL)中的关键环节,现有方法包括贪婪法、高斯过程等。然而,这些方法利用预设的随机过程,且在所有类型的RL任务中无差别地应用,不考虑影响策略探索的任务特定特征。此外,在RL训练期间,这些随机过程的演化僵化,通常仅包含方差衰减,无法灵活地根据agent的实时学习状态进行调整。灵感来自大型语言模型(LLM)的分析和推理能力,我们设计了LLM-Explorer,通过LLM自适应生成任务特定的探索策略,以增强RL中的策略探索。在我们的设计中,我们在给定任务中的RL训练期间对agent的学习轨迹进行采样,并提示LLM分析agent当前的策略学习状态,然后生成用于未来策略探索的概率分布。定期更新概率分布,我们获得一种为特定任务优化且动态调整以适应学习过程的随机过程。我们的设计是与各种广泛应用的RL算法兼容的插件模块,包括DQN系列、DDPG、TD3以及任何基于它们开发的变体。在针对Atari和MuJoCo基准进行大量实验后,我们展示了LLM-Explorer提升RL策略探索能力的能力,通过实验实现了最高可达37.27%的平均性能提升。我们的代码已开源于https://github.com/tsinghua-fib-lab/LLM-Explorer以便复现。

关键词

引用

@article{arxiv.2505.15293,
  title  = {LLM-Explorer: A Plug-in Reinforcement Learning Policy Exploration Enhancement Driven by Large Language Models},
  author = {Qianyue Hao and Yiwen Song and Qingmin Liao and Jian Yuan and Yong Li},
  journal= {arXiv preprint arXiv:2505.15293},
  year   = {2025}
}