用于高效运动学习的末端效应探索驱动
人工智能
2020-10-06 v2 神经与进化计算
机器人学
神经元与认知
摘要
基于强化学习中一个关键目标是反演目标效应分布这一思想,我们提出末端效应驱动作为一种在无显式前向模型情况下实现目标导向运动学习的有效方式。末端效应模型依赖于对当前策略效应的简单统计记录,在此用作资源消耗更大的前向模型的替代。当与奖励结构结合时,它构成了一个轻量级变分自由能最小化框架的核心。主要困难在于维护这一简化效应模型与策略的在线更新。当先验目标分布为均匀分布时,它提供了一种学习高效探索策略的途径,与内在好奇心原理一致。当与外在奖励结合时,我们的方法最终被证明比传统的离策略技术训练更快。
引用
@article{arxiv.2006.15960,
title = {End-Effect Exploration Drive for Effective Motor Learning},
author = {Emmanuel Daucé},
journal= {arXiv preprint arXiv:2006.15960},
year = {2020}
}
备注
6 pages, 3 figures, submitted to IWAI 2020 (1st International Workshop on Active Inference)