用于囚禁逃逸问题的强化学习框架中的脚手架反思方法
机器人学
2021-04-20 v2 机器学习
摘要
本文提出一种新颖的强化学习脚手架反思(SR2L)方法,用于求解囚禁逃逸问题(CEP)。在CEP中,逃逸者的目标是试图逃出由多个追捕者巡逻的囚禁区域。同时,追捕者旨在到达并捕获逃逸者。追捕者尝试捕获的逆解已在文献中被广泛研究。然而,逃逸者逃出该区域的问题仍是一个开放问题。SR2L采用行动者-评论家框架使逃逸者逃出囚禁区域。为实现适当收敛,开发了时变状态表示与奖励函数。该公式利用关于可观测环境的传感器信息及囚禁边界的先验知识。传统的独立行动者-评论家(IAC)方法因奖励稀疏而无法收敛。在具有大面积的动态环境中运行时,该效应变得明显。在SR2L中,除所开发的奖励函数外,我们使用脚手架反思方法显著改善收敛性并提高效率。在SR2L中,运动规划器用作行动者-评论家网络的脚手架,以观察、比较并学习动作-奖励对。它使逃逸者能以更少的资源和时间实现所需目标。收敛研究表明,与IAC相比,SR2L学习更快并收敛到更高奖励。大量蒙特卡洛仿真表明,SR2L作为基线一致优于常规IAC及运动规划器本身。
引用
@article{arxiv.2011.06764,
title = {Scaffolding Reflection in Reinforcement Learning Framework for Confinement Escape Problem},
author = {Nishant Mohanty and Suresh Sundaram},
journal= {arXiv preprint arXiv:2011.06764},
year = {2021}
}
备注
9 pages, 6 figures