基于自适应策略切换的强化学习中时序逻辑约束的概率满足
人工智能
2024-12-02 v2 机器人学
系统与控制
系统与控制
摘要
受约束的强化学习(CRL)是机器学习的一个子集,引入了约束以纳入传统强化学习(RL)框架。与传统 RL 仅致力于最大化累积奖励不同,CRL 包含表示特定任务要求或学习过程中必须遵守的限制的额外约束。在本文中,我们解决了一种 CRL 问题,即智能体旨在最大化奖励,同时确保在整个学习过程中满足所需的时序逻辑约束水平。我们提出了一种新框架,该框架依赖于在纯粹学习(奖励最大化)和约束满足之间进行切换。该框架基于早期试验估计算约束满足的概率,并正确调整在学习和约束满足策略之间的切换概率。我们理论上验证了所提算法的正确性,并通过综合仿真实验展示其性能。
引用
@article{arxiv.2410.08022,
title = {Probabilistic Satisfaction of Temporal Logic Constraints in Reinforcement Learning via Adaptive Policy-Switching},
author = {Xiaoshan Lin and Sadık Bera Yüksel and Yasin Yazıcıoğlu and Derya Aksaray},
journal= {arXiv preprint arXiv:2410.08022},
year = {2024}
}