中文

基于策略生成器的倒置强化学习

机器学习 2025-01-29 v2 人工智能

摘要

倒置强化学习 (UDRL) 是一种解决强化学习问题的有前景框架,专注于学习命令条件化策略。在本工作中,我们将UDRL扩展到学习命令条件化的深度神经网络策略生成器的任务上。我们采用超网络 —— 一种快速权重程序的变体,其学习将代表期望回报的输入命令解码为命令特定的权矩阵。我们的方法称为倒置强化学习与策略生成器 (UDRLPG),通过消除评估器或批评家来更新生成器权重,简化了类似技术。为抵消缺乏评估器导致的最后回报方差增加,我们将抽样缓冲区的概率从生成器中策略的绝对数量中解耦,这结合一种简单的加权策略,可改善算法的经验收敛性。与现有算法相比,UDRLPG 实现了竞争性能和高回报,有时甚至超过更复杂的体系结构。我们的实验表明,训练好的生成器可零样本生成实现未见回报的策略。该方法在缓解学习高度多模态函数的挑战方面效果显著。总体而言,我们认为UDRLPG是实现强化学习更大经验样本效率的重要进展。UDRLPG的完整实现已公开于 https://github.com/JacopoD/udrlpg_。

关键词

引用

@article{arxiv.2501.16288,
  title  = {Upside Down Reinforcement Learning with Policy Generators},
  author = {Jacopo Di Ventura and Dylan R. Ashley and Vincent Herrmann and Francesco Faccio and Jürgen Schmidhuber},
  journal= {arXiv preprint arXiv:2501.16288},
  year   = {2025}
}

备注

4 pages in main text, 4 figures in main text; source code available at https://github.com/JacopoD/udrlpg_