提升使用强化学习的反向链式行为树的性能
系统与控制
2022-02-03 v3 系统与控制
摘要
在本通讯中,我们展示了如何提升使用强化学习(RL)的反向链式行为树(BTs)的性能。BTs 代表了一种将控制策略组合为更高层控制策略的分层模块化方式。反向链式是一种构建 BTs 的设计原则,它以结构化方式将反应性与目标导向动作相结合。反向链式结构还使得 BTs 的收敛性证明成为可能,识别出一组导致所有轨迹收敛到一组期望目标状态的局部条件。本通讯的核心思想是利用理论收敛证明中识别出的条件来设置各独立控制器的 RL 问题,从而提升反向链式 BTs 的性能。特别地,先前分析识别出了所谓的活动约束条件(ACCs),为满足这些条件不应被破坏,以避免不得不返回去处理先前已完成的子目标。我们提出了一种设置 RL 问题的方法,使其不仅实现每个即时子目标,还避免违反所识别的 ACCs。由此带来的性能提升取决于变更前 ACC 违规发生的频率,以及重新达成这些子目标所需付出的努力。所提方法在一个动态仿真环境中予以说明。
引用
@article{arxiv.2112.13744,
title = {Improving the Performance of Backward Chained Behavior Trees that use Reinforcement Learning},
author = {Mart Kartašev and Justin Saler and Petter Ögren},
journal= {arXiv preprint arXiv:2112.13744},
year = {2022}
}