中文

基于强化学习利用极限确定性广义 Büchi 自动机处理软约束的时序逻辑控制

机器人学 2023-01-31 v5 人工智能 形式语言与自动机理论

摘要

本文研究存在不确定性时的运动规划控制综合问题。不确定性考虑于机器人运动和环境属性中,由此产生概率标记马尔可夫决策过程(PL-MDP)。开发了一种无模型强化学习(RL)方法,以生成有限记忆控制策略来满足线性时序逻辑(LTL)公式表达的高层任务。由于不确定性和潜在冲突任务,本工作关注不可行的 LTL 规范,其中提出了一种松弛的 LTL 约束,允许智能体修订其运动计划并将原任务的违例纳入考量以实现部分满足。并开发了一种新型自动机,以提高接受奖励的密度并实现确定性策略。我们提出了一种带有严格分析、保证按递减顺序实现多个目标的 RL 框架:1)满足松弛乘积 MDP 的接受条件;2)降低长期行为中的违例代价。我们提供了仿真和实验结果来验证性能。

关键词

引用

@article{arxiv.2101.10284,
  title  = {Reinforcement Learning Based Temporal Logic Control with Soft Constraints Using Limit-deterministic Generalized Buchi Automata},
  author = {Mingyu Cai and Shaoping Xiao and Zhijun Li and Zhen Kan},
  journal= {arXiv preprint arXiv:2101.10284},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2010.06797, arXiv:2007.14325