用于分层强化学习中即时反应的紧急动作终止
机器学习
2022-11-14 v1 人工智能
多智能体系统
摘要
在大型动力系统中,控制的分层分解是不可避免的。在强化学习(RL)中,这通常通过在高层策略定义子目标并在低层策略实现来解决。达成这些目标可能需要大量时间,而在此期间无法验证它们是否仍值得追求。然而,由于环境的随机性,这些目标可能变得过时。在本文中,我们针对现有方法中的这一不足,提出了一种在高层不断验证高层动作(即低层目标)有效性的方法。如果动作(即低层目标)变得不合适,它们将被更合适的动作所取代。这样,我们结合了分层RL训练快速的优点与扁平RL即时反应的优点。我们在七个基准环境中对所提方法进行了实验研究。
引用
@article{arxiv.2211.06351,
title = {Emergency action termination for immediate reaction in hierarchical reinforcement learning},
author = {Michał Bortkiewicz and Jakub Łyskawa and Paweł Wawrzyński and Mateusz Ostaszewski and Artur Grudkowski and Tomasz Trzciński},
journal= {arXiv preprint arXiv:2211.06351},
year = {2022}
}