基于行为的强化学习中简单反应式神经网络研究
高能物理 - 理论
2020-05-20 v2 高能物理 - 唯象学
摘要
我们提出了一种受 Brooks 包容架构启发的基于行为的强化学习方法,其中简单的全连接网络被训练为反应式行为。我们的工作假设是,拾取与放置机器人任务可通过利用机器人开发者的领域知识来分解并训练此类反应式行为(即接近、抓取与缩回)而得以简化。随后机器人通过 Actor-Critic 架构自主学习如何组合它们。Actor-Critic 策略旨在确定反应式行为于特定时间序列中的激活与抑制机制。我们在一个模拟机器人环境中验证了我们的方法,其任务为拾取一个方块并将其带到目标位置,同时使夹爪自顶部抓取定向。后者代表了一个额外的自由度,当前端到端强化学习难以泛化于此。我们的结果表明,若每种行为被孤立学习再组合以完成任务,机器人学习可更为高效。即,我们的方法在 8,000 回合内学得了拾取与放置任务,相对于端到端方法与现有最优算法所需训练回合数有急剧减少。
引用
@article{arxiv.2001.07972,
title = {Classification of discrete modular symmetries in Type IIB flux vacua},
author = {Tatsuo Kobayashi and Hajime Otsuka},
journal= {arXiv preprint arXiv:2001.07972},
year = {2020}
}
备注
22 pages, v2: published version, typos corrected