中文

协同智能体网络:泛化与规模化

机器学习 2023-05-18 v1 人工智能

摘要

用于强化学习(RL)的协同智能体网络(coagent networks)[Thomas and Barto, 2011] 为任意随机神经网络推导原则性学习规则提供了一个强大而灵活的框架。协同智能体框架提供了基于反向传播深度学习(BDL)的一种替代方案,克服了反向传播的一些主要局限。例如,协同智能体网络可以异步(以不同速率或不同时间)计算网络的不同部分,可以纳入无法与反向传播一起使用的不可微组件,并能在高于其动作空间层级进行探索(即,它们可被设计为用于探索和/或时间抽象的分层网络)。然而,协同智能体框架不仅是 BDL 的替代方案;两种方法可相融合:BDL 可与协同智能体学习规则结合,以创建兼具两者优势的架构。本工作泛化了先前工作给出的协同智能体理论与学习规则;该泛化在协同智能体框架内为网络架构设计提供了更大灵活性。本工作还研究了协同智能体网络的主要缺点之一:对于拥有众多协同智能体且不使用反向传播的网络,其更新具有高方差。我们展示了一种不使用反向传播的、带策略网络的协同智能体算法可扩展到具有高维状态与动作空间的挑战性 RL 领域(MuJoCo Ant 环境),学习到合理(虽非最先进)的策略。这些贡献为未来研究协同智能体网络提供了动机与更一般的理论基础。

关键词

引用

@article{arxiv.2305.09838,
  title  = {Coagent Networks: Generalized and Scaled},
  author = {James E. Kostas and Scott M. Jordan and Yash Chandak and Georgios Theocharous and Dhawal Gupta and Martha White and Bruno Castro da Silva and Philip S. Thomas},
  journal= {arXiv preprint arXiv:2305.09838},
  year   = {2023}
}