基于新型Q集成方法的多智能体多评论家深度确定性强化学习
机器学习
2025-10-02 v1
摘要
近年来,强化学习因其快速发展和丰富应用而备受关注,尤其是在控制系统和机器人领域。当使用强化学习方法处理实际应用时,相应的马尔可夫决策过程可能具有庞大的离散甚至连续的状态/动作空间。多年来,深度强化学习一直被研究通过深度学习来处理这些问题,而演员-评论家架构是一个有前景的分支。许多过去的研究利用多个评论家来提高策略评估的准确性,以解决高估和低估问题。然而,很少有研究考虑将多个演员与多个评论家结合在一起的架构。本研究提出了一种新颖的多智能体多评论家(MAMC)深度确定性强化学习方法。该方法具有三个主要特征:基于非支配排序的演员选择,以在技能和创造性因素方面进行探索;使用基于分位数的集成策略对演员和评论家进行评估;以及利用具有最佳技能因子的演员。理论分析证明了MAMC的学习稳定性和有界估计偏差。本研究在著名的强化学习基准MuJoCo上检验了性能。实验结果表明,所提出的框架优于基于深度确定性的最先进强化学习方法。实验分析还表明所提出的组件是有效的。经验分析进一步调查了所提方法的有效性,并展示了其在复杂问题上的优势。源代码可在https://github.com/AndyWu101/MAMC找到。
引用
@article{arxiv.2510.01083,
title = {Multi-Actor Multi-Critic Deep Deterministic Reinforcement Learning with a Novel Q-Ensemble Method},
author = {Andy Wu and Chun-Cheng Lin and Rung-Tzuo Liaw and Yuehua Huang and Chihjung Kuo and Chia Tong Weng},
journal= {arXiv preprint arXiv:2510.01083},
year = {2025}
}