Wasserstein行动者-评论家:通过乐观主义实现连续动作控制的定向探索
机器学习
2023-03-07 v1 人工智能
摘要
不确定性量化已被广泛用作在强化学习(RL)中实现高效定向探索的手段。然而,针对连续动作的最先进方法仍面临高样本复杂度的需求。实际上,它们要么完全缺乏在更新过程中传播认知不确定性的策略,要么在学习完整回报分布(例如,分布式RL)时将其与偶然不确定性混合。本文提出Wasserstein行动者-评论家(WAC),一种受近期Wasserstein Q学习(WQL)\citep{wql}启发的行动者-评论家架构,其采用近似Q后验来表示认知不确定性,并使用Wasserstein重心跨状态-动作空间传播不确定性。WAC通过以Q值估计上界的优化引导策略学习过程,以原则性方式强制探索。此外,我们研究了在使用函数逼近与不确定性估计结合时出现的一些特殊问题,并为不确定性估计提出正则化损失。最后,我们在标准MujoCo任务以及一系列探索至关重要的连续动作领域上,与最先进基线相比评估了我们的算法。
引用
@article{arxiv.2303.02378,
title = {Wasserstein Actor-Critic: Directed Exploration via Optimism for Continuous-Actions Control},
author = {Amarildo Likmeta and Matteo Sacco and Alberto Maria Metelli and Marcello Restelli},
journal= {arXiv preprint arXiv:2303.02378},
year = {2023}
}