深度强化学习对人类运动学习的启示及反之亦然
神经元与认知
2022-08-29 v2 机器学习
神经与进化计算
摘要
机器学习,特别是强化学习(RL),在帮助我们理解神经决策过程方面极为成功。然而,RL 在理解其他神经过程尤其是运动学习中的作用却鲜有探索。为探究这一联系,我们研究了近期深度 RL 方法如何对应于神经科学中主导的运动学习框架——基于错误的学习(error-based learning)。基于错误的学习可利用镜像反转适应范式进行探测,该范式会产生在人类中观察到的独特定性预测。因此,我们在镜像反转扰动上测试了三类现代深度 RL 算法。令人惊讶的是,所有算法均未能模仿人类行为,且确实表现出与基于错误的学习所预测行为定性不同的行为。为弥补这一差距,我们提出了一种新颖的深度 RL 算法:基于模型的确定性策略梯度(MB-DPG)。MB-DPG 通过显式依赖动作的观察结果,从基于错误的学习中汲取灵感。我们表明 MB-DPG 在镜像反转和旋转扰动下捕捉到了(人类)基于错误的学习。接下来,我们证明以 MB-DPG 形式的基于错误的学习在复杂基于手臂的到达任务上比规范的无模型算法学习更快,同时比基于模型的 RL 对(前向)模型错误设定更具鲁棒性。这些发现凸显了当前深度 RL 方法与人类运动适应之间的差距,并提供了缩小该差距的途径,促进两领域未来有益的互动。
引用
@article{arxiv.2208.10892,
title = {What deep reinforcement learning tells us about human motor learning and vice-versa},
author = {Michele Garibbo and Casimir Ludwig and Nathan Lepora and Laurence Aitchison},
journal= {arXiv preprint arXiv:2208.10892},
year = {2022}
}
备注
23 pages, 5 figures