REValueD:面向可因子化马尔可夫决策过程的正则化集成价值分解
机器学习
2024-03-11 v2 人工智能
摘要
离散动作强化学习算法在处理高维离散动作空间的任务时,常因可能动作数量庞大而表现不佳。近期一项进展利用价值分解(源自多智能体强化学习的概念)来应对这一挑战。本研究深入探讨了这种价值分解的影响,揭示出它在抑制Q学习算法固有的过估计偏差的同时,放大了目标方差。为抵消这一影响,我们提出使用评论家集成来降低目标方差。此外,我们引入了一个正则化损失,有助于减轻某一维度上的探索性动作对其他维度上最优动作价值的影响。我们的新算法REValueD在DeepMind Control Suite任务的离散化版本上进行了测试,展现出卓越性能,尤其是在具有挑战性的humanoid和dog任务中。我们进一步剖析了影响REValueD性能的因素,评估了正则化损失的重要性以及REValueD随每维度子动作数量增加的可扩展性。
引用
@article{arxiv.2401.08850,
title = {REValueD: Regularised Ensemble Value-Decomposition for Factorisable Markov Decision Processes},
author = {David Ireland and Giovanni Montana},
journal= {arXiv preprint arXiv:2401.08850},
year = {2024}
}
备注
ICLR camera ready version