基于漏斗的奖励塑形用于强化学习中的信号时序逻辑任务
系统与控制
2023-12-05 v3 人工智能
机器学习
系统与控制
摘要
信号时序逻辑(STL)是描述动态系统复杂时序与逻辑行为的强大框架。大量研究尝试采用强化学习来学习一个强制满足STL规约的控制器;然而,它们未能有效应对在连续状态空间中确保鲁棒满足并保持可处理性的挑战。本文中,借助漏斗函数概念,我们提出一种可处理的强化学习算法,以学习时间依赖策略,从而在连续状态空间中鲁棒满足STL规约。我们在多个使用不同环境的STL任务上展示了我们方法的效用。
引用
@article{arxiv.2212.03181,
title = {Funnel-based Reward Shaping for Signal Temporal Logic Tasks in Reinforcement Learning},
author = {Naman Saxena and Gorantla Sandeep and Pushpak Jagtap},
journal= {arXiv preprint arXiv:2212.03181},
year = {2023}
}
备注
9 pages, 12 figures