中文

MinMaxMin $Q$-learning

机器学习 2024-06-04 v3 人工智能

摘要

MinMaxMin QQ-learning 是一种新颖的乐观 Actor-Critic 算法,旨在解决保守强化学习算法中固有的过估计偏差(QQ 估计值高估真实 QQ 值)问题。其核心公式依赖于 QQ 网络之间的分歧,该分歧以 min-batch MaxMin QQ-networks 距离的形式被添加到 QQ 目标中,并用作优先经验回放的采样规则。我们在 TD3 和 TD7 的基础上实现了 MinMaxMin,并在流行的 MuJoCo 和 Bullet 环境中,将其与最先进的连续空间算法(DDPG、TD3 和 TD7)进行了严格测试。结果表明,在所有测试任务中,MinMaxMin 相比 DDPG、TD3 和 TD7 均表现出一致的性能提升。

关键词

引用

@article{arxiv.2402.05951,
  title  = {MinMaxMin $Q$-learning},
  author = {Nitsan Soffair and Shie Mannor},
  journal= {arXiv preprint arXiv:2402.05951},
  year   = {2024}
}

备注

Paper do not ready