神经控制机器人中基于多巴胺调制STDP的强化学习
神经与进化计算
2015-02-24 v1 机器人学
摘要
近期研究表明,多巴胺调制的STDP能够解决强化学习相关的诸多问题,例如远端奖励问题。脉冲神经网络在具身情境中实施强化学习时提供了一种有用的技术,因为它们能够处理连续参数空间,从而更善于泛化在给定情境中执行的正确行为。在本项目中,我们在执行食物觅食任务的具身机器人上实现了一种DA调制的STDP。通过模拟多巴胺能神经元,我们展示了机器人如何能够学习一系列行为以获得食物奖励。在测试中,机器人在全部50次试验中均能学习食物吸引行为,并随后在环境改变时遗忘该行为。此外,我们表明机器人能够在最优行为快速变化的环境中运行,因此智能体必须不断重新学习。在由食物容器构成的更复杂环境中,尽管正确行为与奖励之间存在较大的时间距离,机器人在95%的试验中学会了食物容器吸引行为。这是通过将多巴胺响应从初级刺激(食物)转移到次级刺激(食物容器)来实现的。我们的工作为一些观察到的生物现象(例如多巴胺能神经元中观察到的爆发行为)背后的原因提供了见解。同时也展示了脉冲神经网络控制的机器人如何解决一系列强化学习任务。
引用
@article{arxiv.1502.06096,
title = {Reinforcement Learning in a Neurally Controlled Robot Using Dopamine Modulated STDP},
author = {Richard Evans},
journal= {arXiv preprint arXiv:1502.06096},
year = {2015}
}