强化学习中环境设计的重要性:一项关于机器人环境的研究
机器学习
2021-06-29 v2 人工智能
机器人学
摘要
对特定环境的深入理解在强化学习(RL)中至关重要。为应对该挑战,本文研究了由马尔可夫决策过程(MDP)框架建模的移动协作机器人助理的决策过程。MDP 的最优状态-动作组合通过非线性 Bellman 最优方程算出。这一方程组可借助 Wolfram Mathematica 的计算能力相对容易地求解,所得最优动作值指向最优策略。与其他 RL 算法不同,该方法不近似最优行为,而是给出精确的显式解,这为我们的研究提供了坚实基础。据此,我们通过对同一结构进行多种微小修改从而导致不同最优策略,从而对理解 RL 中的动作选择机制提出了新的见解。
引用
@article{arxiv.2102.10447,
title = {Importance of Environment Design in Reinforcement Learning: A Study of a Robotic Environment},
author = {Mónika Farsang and Luca Szegletes},
journal= {arXiv preprint arXiv:2102.10447},
year = {2021}
}