中文

连续控制下的 Broad Critic 深度演员强化学习

机器学习 2025-04-15 v2 人工智能

摘要

在连续控制领域,深度强化学习(DRL)展现出巨大的潜力。然而,DRL 依赖深度神经网络(DNN)导致对大量数据的需求和增加的计算成本。为此,本文引入一种新型的混合 actor-critic 强化学习(RL)框架。该框架将 broad learning system(BLS)与 DNN 集成,旨在融合两种不同架构范式的优势。具体而言,critic 网络采用 BLS 通过岭回归实现快速价值估计,而 actor 网络保留 DNN 结构以优化 policy 梯度。该混合设计具有通用性,可增强现有的 actor-critic 算法。为展示其灵活性,该框架被集成到三个广泛使用的 actor-critic 算法中——深度确定性策略梯度(DDPG)、软 actor-critic(SAC)和 twin delayed DDPG(TD3),生成 BLS 增强版。实验结果表明,所有 BLS 增强版在训练效率和准确性方面均超越其原始版本。这些改进凸显了该框架在实时控制场景中的适合性,其中计算效率和快速适应性至关重要。

关键词

引用

@article{arxiv.2411.15806,
  title  = {Broad Critic Deep Actor Reinforcement Learning for Continuous Control},
  author = {Shiron Thalagala and Pak Kin Wong and Xiaozheng Wang and Tianang Sun},
  journal= {arXiv preprint arXiv:2411.15806},
  year   = {2025}
}

备注

11 pages, The final published version is available at: https://ieeexplore.ieee.org/document/10957827 (DOI: 10.1109/TNNLS.2025.3554082)