中文

持续强化学习中多样化 DQN 变体集成的仲裁控制

机器学习 2025-09-08 v1 多智能体系统

摘要

深度强化学习 (RL) 模型尽管在静态环境中学习最优策略很高效,但很容易丢失先前学到的知识(即灾难性遗忘)。这导致 RL 模型在持续强化学习 (CRL) 场景中表现不佳。为了解决这个问题,我们提出了一种针对 RL 智能体集成的仲裁控制机制。其动机与前额叶皮层中观察到的现象密切相关且高度一致,即人类在 CRL 环境中利用并行的多个 RL 智能体的仲裁控制来做出决策。我们将两个关键思想整合到我们的模型中:(1) 明确训练以具有多样化价值函数的 RL 集成(即 DQN 变体),以及 (2) 一种在最近试验中优先考虑具有更高可靠性(即更少错误)的智能体的仲裁控制。我们提出了一个用于 CRL 的框架,即多样化 DQN 变体集成的仲裁控制 (ACED-DQN)。我们展示了在静态和持续环境中的显著性能提升,并通过经验证据表明在训练期间对多样化 DQN 进行仲裁控制的有效性。在这项工作中,我们引入了一个受人类大脑启发、使 RL 智能体能够持续学习的框架。

关键词

引用

@article{arxiv.2509.04815,
  title  = {An Arbitration Control for an Ensemble of Diversified DQN variants in Continual Reinforcement Learning},
  author = {Wonseo Jang and Dongjae Kim},
  journal= {arXiv preprint arXiv:2509.04815},
  year   = {2025}
}

备注

8 pages, 8 figures