CTD4:一种基于卡尔曼融合多个评论家的深连续分布式演员-评论家智能体
机器学习
2025-02-07 v3 人工智能
摘要
范畴型分布式强化学习(CDRL)在学习复杂任务方面显示出优于传统强化学习(RL)方法的更高样本效率。然而,CDRL的实际应用受到投影步骤、详细参数调优和领域知识的制约。本文通过引入一种专为连续动作空间设计的连续分布式模型无关 RL 算法,旨在解决这些挑战。该算法简化了分布式 RL的实现,采用演员-评论家架构,其中评论家输出连续概率分布。此外,我们提出了通过卡尔曼融合机制融合多个评论家的集成,以缓解高估偏差。通过一系列实验,我们验证了所提出方法为执行复杂连续控制任务提供了样本高效的解决方案。
引用
@article{arxiv.2405.02576,
title = {CTD4 -- A Deep Continuous Distributional Actor-Critic Agent with a Kalman Fusion of Multiple Critics},
author = {David Valencia and Henry Williams and Yuning Xing and Trevor Gee and Bruce A MacDonald and Minas Liarokapis},
journal= {arXiv preprint arXiv:2405.02576},
year = {2025}
}