中文

模块化有益于具有竞争性稳态驱动的强化学习智能体

机器学习 2022-04-15 v1

摘要

平衡冲突需求的问题是智能的根本。标准强化学习算法最大化标量奖励,这需要将不同目标特定的奖励合并为单一数值。或者,也可在动作价值层面组合不同目标,使得负责不同目标的专用模块向决策过程提交不同的动作建议,各自基于相互独立的奖励。本工作中,我们探究这一替代策略的潜在益处。我们研究一个生物学相关的多目标问题——一组变量的持续稳态维持,并比较单体深度 Q 网络与为每个变量配备专用 Q 学习器的模块化网络。我们发现模块化智能体:a) 需要极少的外部设定探索;b) 具有更高的样本效率;c) 对分布外扰动更具鲁棒性。

关键词

引用

@article{arxiv.2204.06608,
  title  = {Modularity benefits reinforcement learning agents with competing homeostatic drives},
  author = {Zack Dulberg and Rachit Dubey and Isabel M. Berwian and Jonathan D. Cohen},
  journal= {arXiv preprint arXiv:2204.06608},
  year   = {2022}
}

备注

4 pages, accepted paper at the Multi-disciplinary Conference on Reinforcement Learning and Decision Making (RLDM) 2022