中文

基于协同探索的结构性信用分配

机器学习 2023-07-26 v1 人工智能

摘要

一种生物学上合理的人工神经网络(ANN)训练方法是将每个单元视为随机强化学习(RL)智能体,从而将网络看作智能体团队。因此,所有单元均可通过 REINFORCE(一种由全局奖励信号调制的局部学习规则)进行学习,这更贴近生物学观测到的突触可塑性形式。然而,该学习方法往往较慢,且不能随网络规模良好扩展。这种低效源于阻碍有效结构性信用分配的两个因素:(i) 所有单元独立探索网络;(ii) 使用单一奖励评估所有单元的动作。相应地,旨在改进结构性信用分配的方法通常可分为两类。第一类包含实现单元间协同探索的算法,如 MAP 传播。第二类包含为网络中每个单元计算更具体奖励信号的算法,如权重最大化(Weight Maximization)及其变体。在本研究报告中,我们关注第一类。我们提出使用玻尔兹曼机或循环网络进行协同探索。我们证明,训练玻尔兹曼机通常必需的负相可以被去除。所得学习规则类似于奖励调制 Hebbian 学习规则。实验结果表明,基于 REINFORCE 的多个随机离散单元训练中,协同探索在训练速度上显著超越独立探索,甚至超过 straight-through estimator (STE) 反向传播。

关键词

引用

@article{arxiv.2307.13256,
  title  = {Structural Credit Assignment with Coordinated Exploration},
  author = {Stephen Chung},
  journal= {arXiv preprint arXiv:2307.13256},
  year   = {2023}
}

备注

17 pages