Conservative DDPG——无集成的悲观强化学习
人工智能
2024-06-04 v2 机器学习
摘要
DDPG 受到过高估计偏差问题的阻碍,其中其 估计倾向于夸大实际的 值。针对这种偏差的传统解决方案包括需要大量计算资源的基于集成的方法,或者难以理解和实现的基于复杂对数策略的方法。相比之下,我们提出了一种直接的解决方案,使用 -target 并结合行为克隆(BC)损失惩罚。该解决方案作为一种不确定性度量,可以通过最少的代码轻松实现,而无需集成。我们的实证结果有力地支持了 Conservative DDPG 在各种 MuJoCo 和 Bullet 任务中相对于 DDPG 的优越性。我们在所有评估的任务中始终观察到更好的性能,甚至与 TD3 和 TD7 相比也具有竞争力或更优的性能,而所有这些都是在显著降低的计算需求下实现的。
引用
@article{arxiv.2403.05732,
title = {Conservative DDPG -- Pessimistic RL without Ensemble},
author = {Nitsan Soffair and Shie Mannor},
journal= {arXiv preprint arXiv:2403.05732},
year = {2024}
}
备注
Paper do not ready