基于扩散策略梯度的多模态行为从头学习
机器学习
2024-06-04 v1
摘要
深度强化学习(RL)算法通常将策略参数化为一个深度网络,该网络输出确定性动作或建模为高斯分布的随机动作,因此将学习限制在单一行为模式。与此同时,扩散模型作为多模态学习的强大框架出现。然而,在在线RL中使用扩散策略受到策略似然近似难以处理以及RL方法的贪婪目标(容易使策略偏向单一模式)的阻碍。本文提出了深度扩散策略梯度(DDiffPG),一种新颖的演员-评论家算法,该算法从头开始学习参数化为扩散模型的多模态策略,同时发现并维持多样化的行为。DDiffPG通过现成的无监督聚类结合基于新奇性的内在动机来探索和发现多种模式。DDiffPG形成多模态训练批次,并利用特定模式的Q学习来减轻RL目标固有的贪婪性,确保扩散策略在所有模式上的改进。我们的方法进一步允许策略以特定模式的嵌入为条件,以显式控制学习到的模式。实证研究验证了DDiffPG在具有稀疏奖励的复杂、高维连续控制任务中掌握多模态行为的能力,并在导航具有未知障碍物的迷宫时展示了概念验证的动态在线重规划。
引用
@article{arxiv.2406.00681,
title = {Learning Multimodal Behaviors from Scratch with Diffusion Policy Gradient},
author = {Zechu Li and Rickmer Krohn and Tao Chen and Anurag Ajay and Pulkit Agrawal and Georgia Chalvatzaki},
journal= {arXiv preprint arXiv:2406.00681},
year = {2024}
}