突破瓶颈:神经调制神经网络中从奖励驱动学习到奖励无关领域自适应学习的演化转变
神经与进化计算
2024-08-05 v2 人工智能
摘要
高级生物智能能够从信息丰富的刺激信息流中高效学习,即使行为质量的反馈稀疏或缺失。此类学习利用了关于任务领域的隐式假设。我们将此类学习称为领域自适应学习(DAL)。相比之下,AI 学习算法依赖外部提供的显式行为质量度量来获取适应性行为。这施加了信息瓶颈,阻碍了从多样化的非奖励刺激信息中学习,限制了学习效率。我们考虑了生物演化如何绕过这一瓶颈以产生 DAL 的问题。我们提出,物种首先进化出从奖励信号中学习的能力,提供低效(受瓶颈限制)但广泛的适应性。在此基础上,非奖励信息向学习过程的整合可以通过此类信息在特定任务领域上诱导的偏差的逐渐积累来进行。这一场景提供了一条通向无瓶颈、领域自适应学习的生物学合理途径。聚焦于该场景的第二阶段,我们建立了一个神经网络群体,其中奖励驱动学习被建模为强化学习(A2C),并允许演化通过神经调制更新机制将非奖励信息整合到学习过程中,以提高学习效率。在连续二维空间的导航任务中,演化出的 DAL 智能体相比纯 RL 智能体展现出 300 倍的学习速度提升。研究发现,演化完全消除了对奖励信息的依赖,允许 DAL 智能体仅从非奖励信息中学习,且仅使用基于局部神经调制的连接权重更新。代码可在 github.com/aislab/dal 获取。
引用
@article{arxiv.2404.12631,
title = {Breaching the Bottleneck: Evolutionary Transition from Reward-Driven Learning to Reward-Agnostic Domain-Adapted Learning in Neuromodulated Neural Nets},
author = {Solvi Arnold and Reiji Suzuki and Takaya Arita and Kimitoshi Yamazaki},
journal= {arXiv preprint arXiv:2404.12631},
year = {2024}
}
备注
Camera ready version. 9 pages, 5 figures